- ICH GCP
- Registro de ensaios clínicos dos EUA
- Ensaio Clínico NCT07500428
Construção de um Benchmark para Interpretação de IA em Ecografia Mamária e Avaliação de Desempenho de Modelos de IA Multimodais (BUST-AI Bench)
Construção de um Sistema de Avaliação de Referência Padronizado para Interpretação Inteligente de Imagens de Ultrassonografia Mamária e Avaliação Sistemática do Desempenho de Modelos de Inteligência Artificial Multimodal Baseados nos Critérios ACR BI-RADS v2025
Este estudo observacional, retrospetivo e unicêntrico tem como objetivo construir um sistema de avaliação de referência padronizado para a interpretação inteligente de imagens de ecografia mamária e avaliar sistematicamente o desempenho diagnóstico dos atuais modelos de inteligência artificial (IA) multimodal predominantes.
Imagens de ecografia mamária em modo B anonimizadas, com diagnósticos patológicos confirmados, serão recolhidas retrospetivamente do arquivo institucional (2018-2025) e complementadas com imagens de conjuntos de dados de acesso aberto publicados. Radiologistas especialistas com diferentes níveis de experiência irão anotar independentemente todas as imagens de acordo com os critérios do Sistema de Relatório e Dados de Imagiologia Mamária (BI-RADS) v2025 do Colégio Americano de Radiologia (ACR), incluindo a composição do tecido glandular, caracterização da lesão (massa vs. lesão não-massa), descritores morfológicos e classificação final do BI-RADS.
Modelos de aprendizagem profunda de referência (ResNet-50 baseado em CNN e USFM baseado em Transformer) serão treinados para estabelecer linhas de base de desempenho e estratificar os casos por dificuldade diagnóstica através de consenso interarquitetura. Vários modelos de linguagem grandes multimodais (MLLM), incluindo modelos de propósito geral e do domínio médico, serão então avaliados através de chamadas API padronizadas utilizando prompts de cadeia de pensamento orientados pelo BI-RADS a temperatura 0 para reprodutibilidade.
Os endpoints primários incluem a precisão da classificação do BI-RADS e a AUC diagnóstica para diferenciação benigna-maligna. A robustez e segurança dos modelos serão avaliadas através de testes de rejeição fora da distribuição, experiências de estabilidade de temperatura e estudos de ablação de modo de pensamento. Este estudo segue as diretrizes de relatório FLAIR e TRIPOD-LLM.
Visão geral do estudo
Status
Intervenção / Tratamento
Descrição detalhada
Antecedentes: O cancro da mama é a neoplasia maligna mais prevalente entre as mulheres em todo o mundo. A ecografia é uma modalidade de rastreio de primeira linha, particularmente em populações asiáticas com tecido mamário denso, onde a sensibilidade mamográfica é limitada. No entanto, a interpretação da ecografia é altamente dependente do operador, com uma variabilidade interobservador substancial na classificação BI-RADS, especialmente para lesões da categoria 4A-4B. Os modelos de linguagem multimodal (MLLMs) surgiram como uma ferramenta promissora para a análise de imagens médicas devido à sua capacidade de diagnóstico zero-shot, ao raciocínio interpretável em cadeia de pensamento e à geração de relatórios estruturados. No entanto, atualmente não existe um benchmark padronizado para avaliar o desempenho da IA na interpretação da ecografia mamária.
Desenho do Estudo: Serão curadas aproximadamente 1.380 imagens de ecografia mamária (1.200 para o conjunto de avaliação + 150 para o conjunto de teste de segurança fora da distribuição + 30 para o conjunto de desenvolvimento de prompts), abrangendo três categorias de diagnóstico: mama normal, lesões benignas (BI-RADS 2-4B) e lesões malignas (BI-RADS 3-5). Dois radiologistas juniores (<5 anos de experiência) e dois radiologistas seniores (>15 anos) irão anotar as imagens de forma independente de acordo com o ACR BI-RADS v2025, com arbitragem de um quinto perito para casos discordantes.
A dificuldade diagnóstica será estratificada em três níveis utilizando consenso de aprendizagem profunda entre arquiteturas: Nível 1 (simples, ambos os modelos corretos), Nível 2 (equívoco, um correto/um incorreto) e Nível 3 (difícil, ambos incorretos, com validação de perito sénior). Os MLLMs serão avaliados em múltiplas dimensões: precisão de classificação, sensibilidade, especificidade, pontuação F1, AUC, concordância de kappa de Cohen com o consenso de peritos, erro de calibração esperado (ECE), precisão da descrição de características morfológicas e qualidade do raciocínio em cadeia de pensamento.
Avaliação de Segurança: (1) Teste de rejeição fora da distribuição utilizando 150 imagens não diagnósticas (imagens degradadas, ecografia não mamária, outras modalidades de imagem); (2) Pré-experimento de estabilidade de temperatura em diferentes configurações de parâmetros; (3) Ablação do modo de pensamento comparando modos de raciocínio padrão vs. em cadeia de pensamento. Todos os experimentos utilizam snapshots de modelos fixos, monitorização de impressão digital do sistema e registo completo para reprodutibilidade.
Tipo de estudo
Inscrição (Estimado)
Contactos e Locais
Contato de estudo
- Nome: Qingli Zhu, MD
- Número de telefone: +86 13621376699
- E-mail: zqlpumch@126.com
Estude backup de contato
- Nome: Yinglan Wu, MD
- Número de telefone: +86 15626121076
- E-mail: wuylan7@gmail.com
Locais de estudo
-
-
-
Beijing, China, 100730
- Recrutamento
- Peking Union Medical College Hospital
-
Contato:
- Qingli Zhu, MD
- Número de telefone: +86 13621376699
- E-mail: zqlpumch@126.com
-
-
Critérios de participação
Critérios de elegibilidade
Idades elegíveis para estudo
- Adulto
- Adulto mais velho
Aceita Voluntários Saudáveis
Método de amostragem
População do estudo
Descrição
Critérios de Inclusão:
- Imagens de ultrassom mamário modo B em escala de cinza da base de dados PACS institucional ou de conjuntos de dados abertos de ultrassom mamário publicados com aprovação ética institucional original documentada
- Qualidade de imagem adequada para diagnóstico clínico com visualização clara da região de interesse
- Diagnóstico patológico confirmado (para grupos de lesões benignas e malignas), ou estado mamário normal confirmado por um radiologista sénior com >15 anos de experiência em ultrassom mamário (para o grupo normal)
- Desidentificação completa com remoção de todas as informações pessoalmente identificáveis
Critérios de Exclusão:
- Qualidade de imagem severamente degradada impedindo avaliação BI-RADS significativa
- Imagens duplicadas do mesmo paciente (apenas a imagem mais representativa retida por lesão)
- Imagens com informações pessoalmente identificáveis residuais após processamento de desidentificação
- Casos com resultados patológicos ambíguos, contestados ou indisponíveis
- Imagens de ultrassom não modo B, incluindo elastografia, ultrassom com contraste e imagem Doppler
Plano de estudo
Como o estudo é projetado?
Detalhes do projeto
Coortes e Intervenções
Grupo / Coorte |
Intervenção / Tratamento |
|---|---|
|
Mama Normal
Imagens de ecografia mamária mostrando tecido glandular normal em diferentes tipos de composição tecidual, sem lesões focais identificadas.
Confirmado por revisão de radiologista sénior.
|
Avaliação retrospetiva de imagens de ultrassom da mama desidentificadas por múltiplos sistemas de IA, incluindo modelos de aprendizagem profunda de base (ResNet-50, USFM) e modelos de linguagem grandes multimodais, utilizando prompts padronizados de cadeia de pensamento orientados pelo BI-RADS via API.
Nenhum contacto com doentes ou tomada de decisões clínicas está envolvido.
|
|
Lesão Benigna
Imagens de ecografia mamária contendo lesões benignas confirmadas patologicamente (BI-RADS 2-4B), incluindo fibroadenoma, quisto, lipoma, adenose esclerosante, papiloma intraductal e lesões não massificadas selecionadas (NML).
|
Avaliação retrospetiva de imagens de ultrassom da mama desidentificadas por múltiplos sistemas de IA, incluindo modelos de aprendizagem profunda de base (ResNet-50, USFM) e modelos de linguagem grandes multimodais, utilizando prompts padronizados de cadeia de pensamento orientados pelo BI-RADS via API.
Nenhum contacto com doentes ou tomada de decisões clínicas está envolvido.
|
|
Lesão Maligna
Imagens de ecografia mamária contendo lesões malignas confirmadas patologicamente (BI-RADS 3-5), incluindo carcinoma ductal invasivo, carcinoma lobular invasivo, carcinoma mucinoso e lesões não-massa selecionadas (NML).
|
Avaliação retrospetiva de imagens de ultrassom da mama desidentificadas por múltiplos sistemas de IA, incluindo modelos de aprendizagem profunda de base (ResNet-50, USFM) e modelos de linguagem grandes multimodais, utilizando prompts padronizados de cadeia de pensamento orientados pelo BI-RADS via API.
Nenhum contacto com doentes ou tomada de decisões clínicas está envolvido.
|
O que o estudo está medindo?
Medidas de resultados primários
Medida de resultado |
Descrição da medida |
Prazo |
|---|---|---|
|
Precisão Diagnóstica para Diagnóstico Patológico
Prazo: No final do estudo, aproximadamente 12 meses
|
Sensibilidade, especificidade, valor preditivo positivo (VPP), valor preditivo negativo (VPN) e pontuação F1 dos modelos de IA para classificação benigna-maligna, com diagnóstico histopatológico como padrão-ouro.
|
No final do estudo, aproximadamente 12 meses
|
|
Precisão da Classificação BI-RADS
Prazo: Ao término do estudo, aproximadamente 12 meses
|
Precisão global dos modelos de IA na atribuição de categorias BI-RADS (2, 3, 4A, 4B, 4C, 5) a imagens de ecografia mamária, comparada com a anotação de consenso de especialistas como padrão de referência.
|
Ao término do estudo, aproximadamente 12 meses
|
Medidas de resultados secundários
Medida de resultado |
Descrição da medida |
Prazo |
|---|---|---|
|
Concordância com o Consenso de Especialistas (Kappa de Cohen)
Prazo: No final do estudo, aproximadamente 12 meses
|
Coeficiente de kappa de Cohen medindo a concordância entre a classificação BI-RADS de cada modelo de IA e a anotação de consenso de especialistas, reportado com intervalos de confiança de 95%.
|
No final do estudo, aproximadamente 12 meses
|
|
Taxa de Rejeição Fora da Distribuição
Prazo: No final do estudo, aproximadamente 12 meses
|
Proporção de imagens não diagnósticas (qualidade degradada, ultrassonografia não mamária, outras modalidades de imagem) corretamente identificadas e recusadas por modelos de IA, avaliando a segurança de domínio.
|
No final do estudo, aproximadamente 12 meses
|
|
Sensibilidade, Especificidade, VPP, VPN e Pontuação F1
Prazo: No final do estudo, aproximadamente 12 meses
|
Métricas de desempenho de diagnóstico padrão para classificação benigno-maligno, relatadas para cada modelo de IA individualmente.
|
No final do estudo, aproximadamente 12 meses
|
Colaboradores e Investigadores
Patrocinador
Colaboradores
Investigadores
- Investigador principal: Qingli Zhu, MD, Peking Union Medical College Hospital
Publicações e links úteis
Publicações Gerais
- Sung H, Ferlay J, Siegel RL, Laversanne M, Soerjomataram I, Jemal A, Bray F. Global Cancer Statistics 2020: GLOBOCAN Estimates of Incidence and Mortality Worldwide for 36 Cancers in 185 Countries. CA Cancer J Clin. 2021 May;71(3):209-249. doi: 10.3322/caac.21660. Epub 2021 Feb 4.
- Bi WL, Hosny A, Schabath MB, Giger ML, Birkbak NJ, Mehrtash A, Allison T, Arnaout O, Abbosh C, Dunn IF, Mak RH, Tamimi RM, Tempany CM, Swanton C, Hoffmann U, Schwartz LH, Gillies RJ, Huang RY, Aerts HJWL. Artificial intelligence in cancer imaging: Clinical challenges and applications. CA Cancer J Clin. 2019 Mar;69(2):127-157. doi: 10.3322/caac.21552. Epub 2019 Feb 5.
- Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, Ghassemi M, Liu X, Reitsma JB, van Smeden M, Boulesteix AL, Camaradou JC, Celi LA, Denaxas S, Denniston AK, Glocker B, Golub RM, Harvey H, Heinze G, Hoffman MM, Kengne AP, Lam E, Lee N, Loder EW, Maier-Hein L, Mateen BA, McCradden MD, Oakden-Rayner L, Ordish J, Parnell R, Rose S, Singh K, Wynants L, Logullo P. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024 Apr 16;385:e078378. doi: 10.1136/bmj-2023-078378.
- Benary M, Wang XD, Schmidt M, Soll D, Hilfenhaus G, Nassir M, Sigler C, Knodler M, Keller U, Beule D, Keilholz U, Leser U, Rieke DT. Leveraging Large Language Models for Decision Support in Personalized Oncology. JAMA Netw Open. 2023 Nov 1;6(11):e2343689. doi: 10.1001/jamanetworkopen.2023.43689.
- Bhayana R, Krishna S, Bleakney RR. Performance of ChatGPT on a Radiology Board-style Examination: Insights into Current Strengths and Limitations. Radiology. 2023 Jun;307(5):e230582. doi: 10.1148/radiol.230582. Epub 2023 May 16.
- Clusmann J, Kolbinger FR, Muti HS, Carrero ZI, Eckardt JN, Laleh NG, Loffler CML, Schwarzkopf SC, Unger M, Veldhuizen GP, Wagner SJ, Kather JN. The future landscape of large language models in medicine. Commun Med (Lond). 2023 Oct 10;3(1):141. doi: 10.1038/s43856-023-00370-1.
- Seyyed-Kalantari L, Zhang H, McDermott MBA, Chen IY, Ghassemi M. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021 Dec;27(12):2176-2182. doi: 10.1038/s41591-021-01595-0. Epub 2021 Dec 10.
- Moor M, Banerjee O, Abad ZSH, Krumholz HM, Leskovec J, Topol EJ, Rajpurkar P. Foundation models for generalist medical artificial intelligence. Nature. 2023 Apr;616(7956):259-265. doi: 10.1038/s41586-023-05881-4. Epub 2023 Apr 12.
- Miaojiao S, Xia L, Xian Tao Z, Zhi Liang H, Sheng C, Songsong W. Using a Large Language Model for Breast Imaging Reporting and Data System Classification and Malignancy Prediction to Enhance Breast Ultrasound Diagnosis: Retrospective Study. JMIR Med Inform. 2025 Jun 11;13:e70924. doi: 10.2196/70924.
- Jiao J, Zhou J, Li X, Xia M, Huang Y, Huang L, Wang N, Zhang X, Zhou S, Wang Y, Guo Y. USFM: A universal ultrasound foundation model generalized to tasks and organs towards label efficient image analysis. Med Image Anal. 2024 Aug;96:103202. doi: 10.1016/j.media.2024.103202. Epub 2024 May 15.
- Xiang H, Wang X, Xu M, Zhang Y, Zeng S, Li C, Liu L, Deng T, Tang G, Yan C, Ou J, Lin Q, He J, Sun P, Li A, Chen H, Heng PA, Lin X. Deep Learning-assisted Diagnosis of Breast Lesions on US Images: A Multivendor, Multicenter Study. Radiol Artif Intell. 2023 Jul 12;5(5):e220185. doi: 10.1148/ryai.220185. eCollection 2023 Sep.
- Kottlors J, Iuga AI, Bluethgen C, Bressem K, Kather JN, Moy L, Wald C, Wang W, Liu T, Ranschaert E, Dratsch T, Kleesiek J, Gertz RJ, Rajpurkar P, Bedayat A, Fink MA, Zeeck A, Chaudhari A, Alkasab T, Wu H, Nensa F, Wang B, Grosse Hokamp N, Laukamp KR, Persigehl T, Maintz D, Truhn D, Lennartz S. Guidelines for Reporting Studies on Large Language Models in Radiology: An International Delphi Expert Survey. Radiology. 2026 Feb;318(2):e250913. doi: 10.1148/radiol.250913.
Datas de registro do estudo
Datas Principais do Estudo
Início do estudo (Real)
Conclusão Primária (Estimado)
Conclusão do estudo (Estimado)
Datas de inscrição no estudo
Enviado pela primeira vez
Enviado pela primeira vez que atendeu aos critérios de CQ
Primeira postagem (Real)
Atualizações de registro de estudo
Última Atualização Postada (Real)
Última atualização enviada que atendeu aos critérios de controle de qualidade
Última verificação
Mais Informações
Termos relacionados a este estudo
Palavras-chave
Termos MeSH relevantes adicionais
Outros números de identificação do estudo
- K10349
- 2024-I2M-CT-B-035 (Número de outro subsídio/financiamento: CAMS Innovation Fund for Medical Sciences)
- I-26PJ0568 (Outro identificador: Ethics Committee, Peking Union Medical College Hospital)
Plano para dados de participantes individuais (IPD)
Planeja compartilhar dados de participantes individuais (IPD)?
Descrição do plano IPD
Prazo de Compartilhamento de IPD
Critérios de acesso de compartilhamento IPD
Tipo de informação de suporte de compartilhamento de IPD
- PROTOCOLO DE ESTUDO
- SEIVA
- ANALYTIC_CODE
Informações sobre medicamentos e dispositivos, documentos de estudo
Estuda um medicamento regulamentado pela FDA dos EUA
Estuda um produto de dispositivo regulamentado pela FDA dos EUA
Essas informações foram obtidas diretamente do site clinicaltrials.gov sem nenhuma alteração. Se você tiver alguma solicitação para alterar, remover ou atualizar os detalhes do seu estudo, entre em contato com register@clinicaltrials.gov. Assim que uma alteração for implementada em clinicaltrials.gov, ela também será atualizada automaticamente em nosso site .