Esta página se tradujo automáticamente y no se garantiza la precisión de la traducción. por favor refiérase a versión inglesa para un texto fuente.

Construcción de un Benchmark para la Interpretación de IA en Ecografía Mamaria y Evaluación del Rendimiento de Modelos de IA Multimodales (BUST-AI Bench)

24 de marzo de 2026 actualizado por: Qingli Zhu, Peking Union Medical College Hospital

Construcción de un Sistema Estándar de Evaluación Comparativa para la Interpretación Inteligente de Imágenes de Ecografía Mamaria y Evaluación Sistemática del Rendimiento de Modelos de Inteligencia Artificial Multimodal Basados en los Criterios ACR BI-RADS v2025

Este estudio observacional retrospectivo de un solo centro tiene como objetivo construir un sistema de evaluación de referencia estandarizado para la interpretación inteligente de imágenes de ecografía mamaria y evaluar sistemáticamente el rendimiento diagnóstico de los modelos actuales principales de inteligencia artificial (IA) multimodal.

Se recopilarán retrospectivamente del archivo institucional (2018-2025) imágenes de ecografía mamaria en modo B anonimizadas con diagnósticos patológicos confirmados, complementadas con imágenes de conjuntos de datos de acceso público publicados. Radiólogos expertos con diferentes niveles de experiencia anotarán de forma independiente todas las imágenes según los criterios del Sistema de Informes y Datos de Imágenes Mamarias (BI-RADS) v2025 del Colegio Americano de Radiología (ACR), incluyendo la composición del tejido glandular, la caracterización de la lesión (masa vs. lesión no masa), descriptores morfológicos y la clasificación final BI-RADS.

Se entrenarán modelos de aprendizaje profundo de referencia (ResNet-50 basado en CNN y USFM basado en Transformer) para establecer líneas base de rendimiento y estratificar casos por dificultad diagnóstica mediante consenso interarquitectura. Luego, se evaluarán múltiples modelos de lenguaje grandes multimodales (MLLM), incluyendo tanto modelos de propósito general como del ámbito médico, mediante llamadas API estandarizadas utilizando instrucciones en cadena de pensamiento guiadas por BI-RADS a temperatura 0 para reproducibilidad.

Los criterios de valoración principales incluyen la precisión de clasificación BI-RADS y el AUC diagnóstico para la diferenciación benigno-maligno. La robustez y seguridad del modelo se evaluarán mediante pruebas de rechazo fuera de distribución, experimentos de estabilidad de temperatura y estudios de ablación de modo de pensamiento. Este estudio se adhiere a las directrices de informes FLAIR y TRIPOD-LLM.

Descripción general del estudio

Descripción detallada

Antecedentes: El cáncer de mama es la neoplasia maligna más prevalente entre las mujeres a nivel mundial. La ecografía es una modalidad de cribado de primera línea, especialmente en poblaciones asiáticas con tejido mamario denso donde la sensibilidad mamográfica es limitada. Sin embargo, la interpretación ecográfica es altamente dependiente del operador, con una variabilidad interobservador sustancial en la clasificación BI-RADS, especialmente para lesiones de categoría 4A-4B. Los modelos de lenguaje multimodal (MLLMs) han surgido como una herramienta prometedora para el análisis de imágenes médicas debido a su capacidad de diagnóstico sin entrenamiento previo (zero-shot), su razonamiento interpretable de cadena de pensamiento y su generación de informes estructurados. No obstante, actualmente no existe un estándar de referencia estandarizado para evaluar el rendimiento de la IA en la interpretación de ecografías mamarias.

Diseño del estudio: Se curarán aproximadamente 1.380 imágenes ecográficas mamarias (1.200 conjunto de evaluación + 150 conjunto de prueba de seguridad fuera de distribución + 30 conjunto de desarrollo de prompts), abarcando tres categorías diagnósticas: mama normal, lesiones benignas (BI-RADS 2-4B) y lesiones malignas (BI-RADS 3-5). Dos radiólogos junior (<5 años de experiencia) y dos radiólogos senior (>15 años) anotarán las imágenes de forma independiente según ACR BI-RADS v2025, con arbitraje de un quinto experto para los casos discordantes.

La dificultad diagnóstica se estratificará en tres niveles utilizando un consenso de aprendizaje profundo de arquitectura cruzada: Nivel 1 (sencillo, ambos modelos correctos), Nivel 2 (equívoco, uno correcto/uno incorrecto) y Nivel 3 (difícil, ambos incorrectos, con validación de experto senior). Los MLLMs se evaluarán en múltiples dimensiones: precisión de clasificación, sensibilidad, especificidad, puntuación F1, AUC, acuerdo de kappa de Cohen con el consenso de expertos, error de calibración esperado (ECE), precisión en la descripción de características morfológicas y calidad del razonamiento de cadena de pensamiento.

Evaluación de seguridad: (1) Prueba de rechazo fuera de distribución utilizando 150 imágenes no diagnósticas (imágenes degradadas, ecografías no mamarias, otras modalidades de imagen); (2) Pre-experimento de estabilidad de temperatura a través de configuraciones de parámetros; (3) Ablación del modo de pensamiento comparando modos de razonamiento estándar versus cadena de pensamiento. Todos los experimentos utilizan instantáneas de modelos fijas, monitorización de huella digital del sistema y registro completo para reproducibilidad.

Tipo de estudio

De observación

Inscripción (Estimado)

1380

Contactos y Ubicaciones

Esta sección proporciona los datos de contacto de quienes realizan el estudio e información sobre dónde se lleva a cabo este estudio.

Estudio Contacto

  • Nombre: Qingli Zhu, MD
  • Número de teléfono: +86 13621376699
  • Correo electrónico: zqlpumch@126.com

Copia de seguridad de contactos de estudio

  • Nombre: Yinglan Wu, MD
  • Número de teléfono: +86 15626121076
  • Correo electrónico: wuylan7@gmail.com

Ubicaciones de estudio

      • Beijing, Porcelana, 100730
        • Reclutamiento
        • Peking Union Medical College Hospital
        • Contacto:
          • Qingli Zhu, MD
          • Número de teléfono: +86 13621376699
          • Correo electrónico: zqlpumch@126.com

Criterios de participación

Los investigadores buscan personas que se ajusten a una determinada descripción, denominada criterio de elegibilidad. Algunos ejemplos de estos criterios son el estado de salud general de una persona o tratamientos previos.

Criterio de elegibilidad

Edades elegibles para estudiar

  • Adulto
  • Adulto Mayor

Acepta Voluntarios Saludables

Sí

Método de muestreo

Muestra no probabilística

Población de estudio

Imágenes de ultrasonido de mama desidentificadas de pacientes adultos que se sometieron a exámenes de ultrasonido mamario en el Hospital de la Facultad de Medicina de la Unión de Pekín entre 2018 y 2025 con confirmación patológica posterior, complementadas con imágenes de conjuntos de datos de ultrasonido mamario de acceso abierto publicados y aprobados éticamente (por ejemplo, BUSI, BrEaST).

Descripción

Criterios de inclusión:

  • Imágenes ecográficas de mama en modo B en escala de grises procedentes de la base de datos PACS institucional o de conjuntos de datos ecográficos de mama de acceso público publicados con aprobación ética institucional original documentada
  • Calidad de imagen adecuada para el diagnóstico clínico con visualización clara de la región de interés
  • Diagnóstico patológico confirmado (para los grupos de lesiones benignas y malignas), o estado mamario normal confirmado por un radiólogo senior con más de 15 años de experiencia en ecografía mamaria (para el grupo normal)
  • Desidentificación completa con eliminación de toda la información de identificación personal

Criterios de exclusión:

  • Calidad de imagen severamente degradada que impida una evaluación BI-RADS significativa
  • Imágenes duplicadas del mismo paciente (solo se conserva la imagen más representativa por lesión)
  • Imágenes con información de identificación personal residual después del procesamiento de desidentificación
  • Casos con resultados patológicos ambiguos, controvertidos o no disponibles
  • Imágenes ecográficas que no sean de modo B, incluyendo elastografía, ecografía con contraste e imágenes Doppler

Plan de estudios

Esta sección proporciona detalles del plan de estudio, incluido cómo está diseñado el estudio y qué mide el estudio.

¿Cómo está diseñado el estudio?

Detalles de diseño

Cohortes e Intervenciones

Grupo / Cohorte
Intervención / Tratamiento
Mama Normal
Imágenes de ecografía mamaria que muestran tejido glandular normal en diferentes tipos de composición tisular, sin identificación de lesiones focales. Confirmado mediante revisión por un radiólogo senior.
Evaluación retrospectiva de imágenes de ultrasonido mamario desidentificadas mediante múltiples sistemas de IA, incluyendo modelos de aprendizaje profundo de referencia (ResNet-50, USFM) y modelos de lenguaje multimodal de gran tamaño, utilizando instrucciones estandarizadas guiadas por BI-RADS mediante cadenas de pensamiento a través de API. No se involucra contacto con pacientes ni toma de decisiones clínicas.
Lesión Benigna
Imágenes de ultrasonido mamario que contienen lesiones benignas confirmadas patológicamente (BI-RADS 2-4B), incluyendo fibroadenoma, quiste, lipoma, adenosis esclerosante, papiloma intraductal y lesiones no masivas seleccionadas (NML).
Evaluación retrospectiva de imágenes de ultrasonido mamario desidentificadas mediante múltiples sistemas de IA, incluyendo modelos de aprendizaje profundo de referencia (ResNet-50, USFM) y modelos de lenguaje multimodal de gran tamaño, utilizando instrucciones estandarizadas guiadas por BI-RADS mediante cadenas de pensamiento a través de API. No se involucra contacto con pacientes ni toma de decisiones clínicas.
Lesión Maligna
Imágenes de ultrasonido mamario que contienen lesiones malignas confirmadas patológicamente (BI-RADS 3-5), incluyendo carcinoma ductal invasivo, carcinoma lobulillar invasivo, carcinoma mucinoso y lesiones no masificadas seleccionadas (NML).
Evaluación retrospectiva de imágenes de ultrasonido mamario desidentificadas mediante múltiples sistemas de IA, incluyendo modelos de aprendizaje profundo de referencia (ResNet-50, USFM) y modelos de lenguaje multimodal de gran tamaño, utilizando instrucciones estandarizadas guiadas por BI-RADS mediante cadenas de pensamiento a través de API. No se involucra contacto con pacientes ni toma de decisiones clínicas.

¿Qué mide el estudio?

Medidas de resultado primarias

Medida de resultado
Medida Descripción
Periodo de tiempo
Precisión diagnóstica para el diagnóstico patológico
Periodo de tiempo: Al finalizar el estudio, aproximadamente 12 meses
Sensibilidad, especificidad, valor predictivo positivo (VPP), valor predictivo negativo (VPN) y puntuación F1 de los modelos de IA para la clasificación benigno-maligno, con el diagnóstico histopatológico como estándar de referencia.
Al finalizar el estudio, aproximadamente 12 meses
Exactitud de la Clasificación BI-RADS
Periodo de tiempo: Al finalizar el estudio, aproximadamente 12 meses
Precisión general de los modelos de IA en la asignación de categorías BI-RADS (2, 3, 4A, 4B, 4C, 5) a imágenes de ecografía mamaria, en comparación con la anotación de consenso de expertos como estándar de referencia.
Al finalizar el estudio, aproximadamente 12 meses

Medidas de resultado secundarias

Medida de resultado
Medida Descripción
Periodo de tiempo
Concordancia con el Consenso de Expertos (Kappa de Cohen)
Periodo de tiempo: Al finalizar el estudio, aproximadamente 12 meses
Coeficiente kappa de Cohen que mide la concordancia entre la clasificación BI-RADS de cada modelo de IA y la anotación del consenso de expertos, reportado con intervalos de confianza del 95%.
Al finalizar el estudio, aproximadamente 12 meses
Tasa de Rechazo Fuera de Distribución
Periodo de tiempo: Al finalizar el estudio, aproximadamente 12 meses
Proporción de imágenes no diagnósticas (calidad degradada, ultrasonido no mamario, otras modalidades de imagen) correctamente identificadas y rechazadas por modelos de IA, evaluando la seguridad del dominio.
Al finalizar el estudio, aproximadamente 12 meses
Sensibilidad, Especificidad, VPP, VPN y Puntuación F1
Periodo de tiempo: Al finalizar el estudio, aproximadamente 12 meses
Métricas de rendimiento de diagnóstico estándar para la clasificación benigna-maligna, informadas para cada modelo de IA individualmente.
Al finalizar el estudio, aproximadamente 12 meses

Colaboradores e Investigadores

Aquí es donde encontrará personas y organizaciones involucradas en este estudio.

Investigadores

  • Investigador principal: Qingli Zhu, MD, Peking Union Medical College Hospital

Publicaciones y enlaces útiles

La persona responsable de ingresar información sobre el estudio proporciona voluntariamente estas publicaciones. Estos pueden ser sobre cualquier cosa relacionada con el estudio.

Publicaciones Generales

Fechas de registro del estudio

Estas fechas rastrean el progreso del registro del estudio y los envíos de resultados resumidos a ClinicalTrials.gov. Los registros del estudio y los resultados informados son revisados ​​por la Biblioteca Nacional de Medicina (NLM) para asegurarse de que cumplan con los estándares de control de calidad específicos antes de publicarlos en el sitio web público.

Fechas importantes del estudio

Inicio del estudio (Actual)

12 de marzo de 2026

Finalización primaria (Estimado)

1 de diciembre de 2026

Finalización del estudio (Estimado)

1 de marzo de 2027

Fechas de registro del estudio

Enviado por primera vez

24 de marzo de 2026

Primero enviado que cumplió con los criterios de control de calidad

24 de marzo de 2026

Publicado por primera vez (Actual)

30 de marzo de 2026

Actualizaciones de registros de estudio

Última actualización publicada (Actual)

30 de marzo de 2026

Última actualización enviada que cumplió con los criterios de control de calidad

24 de marzo de 2026

Última verificación

1 de marzo de 2026

Más información

Términos relacionados con este estudio

Otros números de identificación del estudio

  • K10349
  • 2024-I2M-CT-B-035 (Otro número de subvención/financiamiento: CAMS Innovation Fund for Medical Sciences)
  • I-26PJ0568 (Otro identificador: Ethics Committee, Peking Union Medical College Hospital)

Plan de datos de participantes individuales (IPD)

¿Planea compartir datos de participantes individuales (IPD)?

SÍ

Descripción del plan IPD

El conjunto de datos de evaluación de referencia anonimizado, que incluye imágenes de ultrasonido mamario anotadas por expertos con informes de lectura BI-RADS emparejados, está previsto para su lanzamiento público con el fin de promover la reproducibilidad académica y la investigación colaborativa.

Marco de tiempo para compartir IPD

Dentro de los 6 meses posteriores a la publicación principal, disponible indefinidamente

Criterios de acceso compartido de IPD

Acceso abierto a través de un repositorio de datos reconocido (por determinar)

Tipo de información de apoyo para compartir IPD

  • PROTOCOLO DE ESTUDIO
  • SAVIA
  • CÓDIGO_ANALÍTICO

Información sobre medicamentos y dispositivos, documentos del estudio

Estudia un producto farmacéutico regulado por la FDA de EE. UU.

No

Estudia un producto de dispositivo regulado por la FDA de EE. UU.

No

Esta información se obtuvo directamente del sitio web clinicaltrials.gov sin cambios. Si tiene alguna solicitud para cambiar, eliminar o actualizar los detalles de su estudio, comuníquese con register@clinicaltrials.gov. Tan pronto como se implemente un cambio en clinicaltrials.gov, también se actualizará automáticamente en nuestro sitio web. .

Suscribir