Construcción de un Benchmark para la Interpretación de IA en Ecografía Mamaria y Evaluación del Rendimiento de Modelos de IA Multimodales (BUST-AI Bench)
Construcción de un Sistema Estándar de Evaluación Comparativa para la Interpretación Inteligente de Imágenes de Ecografía Mamaria y Evaluación Sistemática del Rendimiento de Modelos de Inteligencia Artificial Multimodal Basados en los Criterios ACR BI-RADS v2025
Este estudio observacional retrospectivo de un solo centro tiene como objetivo construir un sistema de evaluación de referencia estandarizado para la interpretación inteligente de imágenes de ecografía mamaria y evaluar sistemáticamente el rendimiento diagnóstico de los modelos actuales principales de inteligencia artificial (IA) multimodal.
Se recopilarán retrospectivamente del archivo institucional (2018-2025) imágenes de ecografía mamaria en modo B anonimizadas con diagnósticos patológicos confirmados, complementadas con imágenes de conjuntos de datos de acceso público publicados. Radiólogos expertos con diferentes niveles de experiencia anotarán de forma independiente todas las imágenes según los criterios del Sistema de Informes y Datos de Imágenes Mamarias (BI-RADS) v2025 del Colegio Americano de Radiología (ACR), incluyendo la composición del tejido glandular, la caracterización de la lesión (masa vs. lesión no masa), descriptores morfológicos y la clasificación final BI-RADS.
Se entrenarán modelos de aprendizaje profundo de referencia (ResNet-50 basado en CNN y USFM basado en Transformer) para establecer líneas base de rendimiento y estratificar casos por dificultad diagnóstica mediante consenso interarquitectura. Luego, se evaluarán múltiples modelos de lenguaje grandes multimodales (MLLM), incluyendo tanto modelos de propósito general como del ámbito médico, mediante llamadas API estandarizadas utilizando instrucciones en cadena de pensamiento guiadas por BI-RADS a temperatura 0 para reproducibilidad.
Los criterios de valoración principales incluyen la precisión de clasificación BI-RADS y el AUC diagnóstico para la diferenciación benigno-maligno. La robustez y seguridad del modelo se evaluarán mediante pruebas de rechazo fuera de distribución, experimentos de estabilidad de temperatura y estudios de ablación de modo de pensamiento. Este estudio se adhiere a las directrices de informes FLAIR y TRIPOD-LLM.
Descripción general del estudio
Estado
Estado
Condiciones
Condiciones
Intervención / Tratamiento
Intervención / Tratamiento
Descripción detallada
Antecedentes: El cáncer de mama es la neoplasia maligna más prevalente entre las mujeres a nivel mundial. La ecografía es una modalidad de cribado de primera línea, especialmente en poblaciones asiáticas con tejido mamario denso donde la sensibilidad mamográfica es limitada. Sin embargo, la interpretación ecográfica es altamente dependiente del operador, con una variabilidad interobservador sustancial en la clasificación BI-RADS, especialmente para lesiones de categoría 4A-4B. Los modelos de lenguaje multimodal (MLLMs) han surgido como una herramienta prometedora para el análisis de imágenes médicas debido a su capacidad de diagnóstico sin entrenamiento previo (zero-shot), su razonamiento interpretable de cadena de pensamiento y su generación de informes estructurados. No obstante, actualmente no existe un estándar de referencia estandarizado para evaluar el rendimiento de la IA en la interpretación de ecografías mamarias.
Diseño del estudio: Se curarán aproximadamente 1.380 imágenes ecográficas mamarias (1.200 conjunto de evaluación + 150 conjunto de prueba de seguridad fuera de distribución + 30 conjunto de desarrollo de prompts), abarcando tres categorías diagnósticas: mama normal, lesiones benignas (BI-RADS 2-4B) y lesiones malignas (BI-RADS 3-5). Dos radiólogos junior (<5 años de experiencia) y dos radiólogos senior (>15 años) anotarán las imágenes de forma independiente según ACR BI-RADS v2025, con arbitraje de un quinto experto para los casos discordantes.
La dificultad diagnóstica se estratificará en tres niveles utilizando un consenso de aprendizaje profundo de arquitectura cruzada: Nivel 1 (sencillo, ambos modelos correctos), Nivel 2 (equívoco, uno correcto/uno incorrecto) y Nivel 3 (difícil, ambos incorrectos, con validación de experto senior). Los MLLMs se evaluarán en múltiples dimensiones: precisión de clasificación, sensibilidad, especificidad, puntuación F1, AUC, acuerdo de kappa de Cohen con el consenso de expertos, error de calibración esperado (ECE), precisión en la descripción de características morfológicas y calidad del razonamiento de cadena de pensamiento.
Evaluación de seguridad: (1) Prueba de rechazo fuera de distribución utilizando 150 imágenes no diagnósticas (imágenes degradadas, ecografías no mamarias, otras modalidades de imagen); (2) Pre-experimento de estabilidad de temperatura a través de configuraciones de parámetros; (3) Ablación del modo de pensamiento comparando modos de razonamiento estándar versus cadena de pensamiento. Todos los experimentos utilizan instantáneas de modelos fijas, monitorización de huella digital del sistema y registro completo para reproducibilidad.
Tipo de estudio
Tipo de estudio
Inscripción (Estimado)
Inscripción
Contactos y Ubicaciones
Estudio Contacto
Estudio Contacto
- Nombre: Qingli Zhu, MD
- Número de teléfono: +86 13621376699
- Correo electrónico: zqlpumch@126.com
Copia de seguridad de contactos de estudio
- Nombre: Yinglan Wu, MD
- Número de teléfono: +86 15626121076
- Correo electrónico: wuylan7@gmail.com
Ubicaciones de estudio
-
-
-
Beijing, Porcelana, 100730
- Reclutamiento
- Peking Union Medical College Hospital
-
Contacto:
- Qingli Zhu, MD
- Número de teléfono: +86 13621376699
- Correo electrónico: zqlpumch@126.com
-
-
Criterios de participación
Criterio de elegibilidad
Criterio de elegibilidad
Edades elegibles para estudiar
- Adulto
- Adulto Mayor
Acepta Voluntarios Saludables
Método de muestreo
Población de estudio
Descripción
Criterios de inclusión:
- Imágenes ecográficas de mama en modo B en escala de grises procedentes de la base de datos PACS institucional o de conjuntos de datos ecográficos de mama de acceso público publicados con aprobación ética institucional original documentada
- Calidad de imagen adecuada para el diagnóstico clínico con visualización clara de la región de interés
- Diagnóstico patológico confirmado (para los grupos de lesiones benignas y malignas), o estado mamario normal confirmado por un radiólogo senior con más de 15 años de experiencia en ecografía mamaria (para el grupo normal)
- Desidentificación completa con eliminación de toda la información de identificación personal
Criterios de exclusión:
- Calidad de imagen severamente degradada que impida una evaluación BI-RADS significativa
- Imágenes duplicadas del mismo paciente (solo se conserva la imagen más representativa por lesión)
- Imágenes con información de identificación personal residual después del procesamiento de desidentificación
- Casos con resultados patológicos ambiguos, controvertidos o no disponibles
- Imágenes ecográficas que no sean de modo B, incluyendo elastografía, ecografía con contraste e imágenes Doppler
Plan de estudios
¿Cómo está diseñado el estudio?
Detalles de diseño
Número de grupos/cohortes
Cohortes e Intervenciones
Grupo / CohorteGrupo / Cohorte |
Intervención / TratamientoIntervención / Tratamiento |
|---|---|
|
Mama Normal
Imágenes de ecografía mamaria que muestran tejido glandular normal en diferentes tipos de composición tisular, sin identificación de lesiones focales.
Confirmado mediante revisión por un radiólogo senior.
|
Evaluación retrospectiva de imágenes de ultrasonido mamario desidentificadas mediante múltiples sistemas de IA, incluyendo modelos de aprendizaje profundo de referencia (ResNet-50, USFM) y modelos de lenguaje multimodal de gran tamaño, utilizando instrucciones estandarizadas guiadas por BI-RADS mediante cadenas de pensamiento a través de API.
No se involucra contacto con pacientes ni toma de decisiones clínicas.
|
|
Lesión Benigna
Imágenes de ultrasonido mamario que contienen lesiones benignas confirmadas patológicamente (BI-RADS 2-4B), incluyendo fibroadenoma, quiste, lipoma, adenosis esclerosante, papiloma intraductal y lesiones no masivas seleccionadas (NML).
|
Evaluación retrospectiva de imágenes de ultrasonido mamario desidentificadas mediante múltiples sistemas de IA, incluyendo modelos de aprendizaje profundo de referencia (ResNet-50, USFM) y modelos de lenguaje multimodal de gran tamaño, utilizando instrucciones estandarizadas guiadas por BI-RADS mediante cadenas de pensamiento a través de API.
No se involucra contacto con pacientes ni toma de decisiones clínicas.
|
|
Lesión Maligna
Imágenes de ultrasonido mamario que contienen lesiones malignas confirmadas patológicamente (BI-RADS 3-5), incluyendo carcinoma ductal invasivo, carcinoma lobulillar invasivo, carcinoma mucinoso y lesiones no masificadas seleccionadas (NML).
|
Evaluación retrospectiva de imágenes de ultrasonido mamario desidentificadas mediante múltiples sistemas de IA, incluyendo modelos de aprendizaje profundo de referencia (ResNet-50, USFM) y modelos de lenguaje multimodal de gran tamaño, utilizando instrucciones estandarizadas guiadas por BI-RADS mediante cadenas de pensamiento a través de API.
No se involucra contacto con pacientes ni toma de decisiones clínicas.
|
¿Qué mide el estudio?
Medidas de resultado primarias
Medidas de resultado primarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Precisión diagnóstica para el diagnóstico patológico
Periodo de tiempo: Al finalizar el estudio, aproximadamente 12 meses
|
Sensibilidad, especificidad, valor predictivo positivo (VPP), valor predictivo negativo (VPN) y puntuación F1 de los modelos de IA para la clasificación benigno-maligno, con el diagnóstico histopatológico como estándar de referencia.
|
Al finalizar el estudio, aproximadamente 12 meses
|
|
Exactitud de la Clasificación BI-RADS
Periodo de tiempo: Al finalizar el estudio, aproximadamente 12 meses
|
Precisión general de los modelos de IA en la asignación de categorías BI-RADS (2, 3, 4A, 4B, 4C, 5) a imágenes de ecografía mamaria, en comparación con la anotación de consenso de expertos como estándar de referencia.
|
Al finalizar el estudio, aproximadamente 12 meses
|
Medidas de resultado secundarias
Medidas de resultado secundarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Concordancia con el Consenso de Expertos (Kappa de Cohen)
Periodo de tiempo: Al finalizar el estudio, aproximadamente 12 meses
|
Coeficiente kappa de Cohen que mide la concordancia entre la clasificación BI-RADS de cada modelo de IA y la anotación del consenso de expertos, reportado con intervalos de confianza del 95%.
|
Al finalizar el estudio, aproximadamente 12 meses
|
|
Tasa de Rechazo Fuera de Distribución
Periodo de tiempo: Al finalizar el estudio, aproximadamente 12 meses
|
Proporción de imágenes no diagnósticas (calidad degradada, ultrasonido no mamario, otras modalidades de imagen) correctamente identificadas y rechazadas por modelos de IA, evaluando la seguridad del dominio.
|
Al finalizar el estudio, aproximadamente 12 meses
|
|
Sensibilidad, Especificidad, VPP, VPN y Puntuación F1
Periodo de tiempo: Al finalizar el estudio, aproximadamente 12 meses
|
Métricas de rendimiento de diagnóstico estándar para la clasificación benigna-maligna, informadas para cada modelo de IA individualmente.
|
Al finalizar el estudio, aproximadamente 12 meses
|
Colaboradores e Investigadores
Patrocinador
Patrocinador
Colaboradores
Colaboradores
Investigadores
Investigadores
- Investigador principal: Qingli Zhu, MD, Peking Union Medical College Hospital
Publicaciones y enlaces útiles
Publicaciones Generales
- Sung H, Ferlay J, Siegel RL, Laversanne M, Soerjomataram I, Jemal A, Bray F. Global Cancer Statistics 2020: GLOBOCAN Estimates of Incidence and Mortality Worldwide for 36 Cancers in 185 Countries. CA Cancer J Clin. 2021 May;71(3):209-249. doi: 10.3322/caac.21660. Epub 2021 Feb 4.
- Bi WL, Hosny A, Schabath MB, Giger ML, Birkbak NJ, Mehrtash A, Allison T, Arnaout O, Abbosh C, Dunn IF, Mak RH, Tamimi RM, Tempany CM, Swanton C, Hoffmann U, Schwartz LH, Gillies RJ, Huang RY, Aerts HJWL. Artificial intelligence in cancer imaging: Clinical challenges and applications. CA Cancer J Clin. 2019 Mar;69(2):127-157. doi: 10.3322/caac.21552. Epub 2019 Feb 5.
- Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, Ghassemi M, Liu X, Reitsma JB, van Smeden M, Boulesteix AL, Camaradou JC, Celi LA, Denaxas S, Denniston AK, Glocker B, Golub RM, Harvey H, Heinze G, Hoffman MM, Kengne AP, Lam E, Lee N, Loder EW, Maier-Hein L, Mateen BA, McCradden MD, Oakden-Rayner L, Ordish J, Parnell R, Rose S, Singh K, Wynants L, Logullo P. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024 Apr 16;385:e078378. doi: 10.1136/bmj-2023-078378.
- Benary M, Wang XD, Schmidt M, Soll D, Hilfenhaus G, Nassir M, Sigler C, Knodler M, Keller U, Beule D, Keilholz U, Leser U, Rieke DT. Leveraging Large Language Models for Decision Support in Personalized Oncology. JAMA Netw Open. 2023 Nov 1;6(11):e2343689. doi: 10.1001/jamanetworkopen.2023.43689.
- Bhayana R, Krishna S, Bleakney RR. Performance of ChatGPT on a Radiology Board-style Examination: Insights into Current Strengths and Limitations. Radiology. 2023 Jun;307(5):e230582. doi: 10.1148/radiol.230582. Epub 2023 May 16.
- Clusmann J, Kolbinger FR, Muti HS, Carrero ZI, Eckardt JN, Laleh NG, Loffler CML, Schwarzkopf SC, Unger M, Veldhuizen GP, Wagner SJ, Kather JN. The future landscape of large language models in medicine. Commun Med (Lond). 2023 Oct 10;3(1):141. doi: 10.1038/s43856-023-00370-1.
- Seyyed-Kalantari L, Zhang H, McDermott MBA, Chen IY, Ghassemi M. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021 Dec;27(12):2176-2182. doi: 10.1038/s41591-021-01595-0. Epub 2021 Dec 10.
- Moor M, Banerjee O, Abad ZSH, Krumholz HM, Leskovec J, Topol EJ, Rajpurkar P. Foundation models for generalist medical artificial intelligence. Nature. 2023 Apr;616(7956):259-265. doi: 10.1038/s41586-023-05881-4. Epub 2023 Apr 12.
- Miaojiao S, Xia L, Xian Tao Z, Zhi Liang H, Sheng C, Songsong W. Using a Large Language Model for Breast Imaging Reporting and Data System Classification and Malignancy Prediction to Enhance Breast Ultrasound Diagnosis: Retrospective Study. JMIR Med Inform. 2025 Jun 11;13:e70924. doi: 10.2196/70924.
- Jiao J, Zhou J, Li X, Xia M, Huang Y, Huang L, Wang N, Zhang X, Zhou S, Wang Y, Guo Y. USFM: A universal ultrasound foundation model generalized to tasks and organs towards label efficient image analysis. Med Image Anal. 2024 Aug;96:103202. doi: 10.1016/j.media.2024.103202. Epub 2024 May 15.
- Xiang H, Wang X, Xu M, Zhang Y, Zeng S, Li C, Liu L, Deng T, Tang G, Yan C, Ou J, Lin Q, He J, Sun P, Li A, Chen H, Heng PA, Lin X. Deep Learning-assisted Diagnosis of Breast Lesions on US Images: A Multivendor, Multicenter Study. Radiol Artif Intell. 2023 Jul 12;5(5):e220185. doi: 10.1148/ryai.220185. eCollection 2023 Sep.
- Kottlors J, Iuga AI, Bluethgen C, Bressem K, Kather JN, Moy L, Wald C, Wang W, Liu T, Ranschaert E, Dratsch T, Kleesiek J, Gertz RJ, Rajpurkar P, Bedayat A, Fink MA, Zeeck A, Chaudhari A, Alkasab T, Wu H, Nensa F, Wang B, Grosse Hokamp N, Laukamp KR, Persigehl T, Maintz D, Truhn D, Lennartz S. Guidelines for Reporting Studies on Large Language Models in Radiology: An International Delphi Expert Survey. Radiology. 2026 Feb;318(2):e250913. doi: 10.1148/radiol.250913.
Fechas de registro del estudio
Fechas importantes del estudio
Inicio del estudio (Actual)
Inicio del estudio
Finalización primaria (Estimado)
Finalización primaria
Finalización del estudio (Estimado)
Finalización del estudio
Fechas de registro del estudio
Enviado por primera vez
Enviado por primera vez
Primero enviado que cumplió con los criterios de control de calidad
Primero enviado que cumplió con los criterios de control de calidad
Publicado por primera vez (Actual)
Publicado por primera vez
Actualizaciones de registros de estudio
Última actualización publicada (Actual)
Última actualización publicada
Última actualización enviada que cumplió con los criterios de control de calidad
Última actualización enviada que cumplió con los criterios de control de calidad
Última verificación
Última verificación
Más información
Términos relacionados con este estudio
Palabras clave
Términos MeSH relevantes adicionales
Otros números de identificación del estudio
Otros números de identificación del estudio
- K10349
- 2024-I2M-CT-B-035 (Otro número de subvención/financiamiento: CAMS Innovation Fund for Medical Sciences)
- I-26PJ0568 (Otro identificador: Ethics Committee, Peking Union Medical College Hospital)
Plan de datos de participantes individuales (IPD)
¿Planea compartir datos de participantes individuales (IPD)?
Descripción del plan IPD
Marco de tiempo para compartir IPD
Criterios de acceso compartido de IPD
Tipo de información de apoyo para compartir IPD
- PROTOCOLO DE ESTUDIO
- SAVIA
- CÓDIGO_ANALÍTICO
Información sobre medicamentos y dispositivos, documentos del estudio
Estudia un producto farmacéutico regulado por la FDA de EE. UU.
Estudia un producto de dispositivo regulado por la FDA de EE. UU.
Esta información se obtuvo directamente del sitio web clinicaltrials.gov sin cambios. Si tiene alguna solicitud para cambiar, eliminar o actualizar los detalles de su estudio, comuníquese con register@clinicaltrials.gov. Tan pronto como se implemente un cambio en clinicaltrials.gov, también se actualizará automáticamente en nuestro sitio web. .