Esta página foi traduzida automaticamente e a precisão da tradução não é garantida. Por favor, consulte o versão em inglês para um texto fonte.

Construção de um Benchmark para Interpretação de IA em Ecografia Mamária e Avaliação de Desempenho de Modelos de IA Multimodais (BUST-AI Bench)

24 de março de 2026 atualizado por: Qingli Zhu, Peking Union Medical College Hospital

Construção de um Sistema de Avaliação de Referência Padronizado para Interpretação Inteligente de Imagens de Ultrassonografia Mamária e Avaliação Sistemática do Desempenho de Modelos de Inteligência Artificial Multimodal Baseados nos Critérios ACR BI-RADS v2025

Este estudo observacional, retrospetivo e unicêntrico tem como objetivo construir um sistema de avaliação de referência padronizado para a interpretação inteligente de imagens de ecografia mamária e avaliar sistematicamente o desempenho diagnóstico dos atuais modelos de inteligência artificial (IA) multimodal predominantes.

Imagens de ecografia mamária em modo B anonimizadas, com diagnósticos patológicos confirmados, serão recolhidas retrospetivamente do arquivo institucional (2018-2025) e complementadas com imagens de conjuntos de dados de acesso aberto publicados. Radiologistas especialistas com diferentes níveis de experiência irão anotar independentemente todas as imagens de acordo com os critérios do Sistema de Relatório e Dados de Imagiologia Mamária (BI-RADS) v2025 do Colégio Americano de Radiologia (ACR), incluindo a composição do tecido glandular, caracterização da lesão (massa vs. lesão não-massa), descritores morfológicos e classificação final do BI-RADS.

Modelos de aprendizagem profunda de referência (ResNet-50 baseado em CNN e USFM baseado em Transformer) serão treinados para estabelecer linhas de base de desempenho e estratificar os casos por dificuldade diagnóstica através de consenso interarquitetura. Vários modelos de linguagem grandes multimodais (MLLM), incluindo modelos de propósito geral e do domínio médico, serão então avaliados através de chamadas API padronizadas utilizando prompts de cadeia de pensamento orientados pelo BI-RADS a temperatura 0 para reprodutibilidade.

Os endpoints primários incluem a precisão da classificação do BI-RADS e a AUC diagnóstica para diferenciação benigna-maligna. A robustez e segurança dos modelos serão avaliadas através de testes de rejeição fora da distribuição, experiências de estabilidade de temperatura e estudos de ablação de modo de pensamento. Este estudo segue as diretrizes de relatório FLAIR e TRIPOD-LLM.

Visão geral do estudo

Status

Recrutamento

Condições

Intervenção / Tratamento

Descrição detalhada

Antecedentes: O cancro da mama é a neoplasia maligna mais prevalente entre as mulheres em todo o mundo. A ecografia é uma modalidade de rastreio de primeira linha, particularmente em populações asiáticas com tecido mamário denso, onde a sensibilidade mamográfica é limitada. No entanto, a interpretação da ecografia é altamente dependente do operador, com uma variabilidade interobservador substancial na classificação BI-RADS, especialmente para lesões da categoria 4A-4B. Os modelos de linguagem multimodal (MLLMs) surgiram como uma ferramenta promissora para a análise de imagens médicas devido à sua capacidade de diagnóstico zero-shot, ao raciocínio interpretável em cadeia de pensamento e à geração de relatórios estruturados. No entanto, atualmente não existe um benchmark padronizado para avaliar o desempenho da IA na interpretação da ecografia mamária.

Desenho do Estudo: Serão curadas aproximadamente 1.380 imagens de ecografia mamária (1.200 para o conjunto de avaliação + 150 para o conjunto de teste de segurança fora da distribuição + 30 para o conjunto de desenvolvimento de prompts), abrangendo três categorias de diagnóstico: mama normal, lesões benignas (BI-RADS 2-4B) e lesões malignas (BI-RADS 3-5). Dois radiologistas juniores (<5 anos de experiência) e dois radiologistas seniores (>15 anos) irão anotar as imagens de forma independente de acordo com o ACR BI-RADS v2025, com arbitragem de um quinto perito para casos discordantes.

A dificuldade diagnóstica será estratificada em três níveis utilizando consenso de aprendizagem profunda entre arquiteturas: Nível 1 (simples, ambos os modelos corretos), Nível 2 (equívoco, um correto/um incorreto) e Nível 3 (difícil, ambos incorretos, com validação de perito sénior). Os MLLMs serão avaliados em múltiplas dimensões: precisão de classificação, sensibilidade, especificidade, pontuação F1, AUC, concordância de kappa de Cohen com o consenso de peritos, erro de calibração esperado (ECE), precisão da descrição de características morfológicas e qualidade do raciocínio em cadeia de pensamento.

Avaliação de Segurança: (1) Teste de rejeição fora da distribuição utilizando 150 imagens não diagnósticas (imagens degradadas, ecografia não mamária, outras modalidades de imagem); (2) Pré-experimento de estabilidade de temperatura em diferentes configurações de parâmetros; (3) Ablação do modo de pensamento comparando modos de raciocínio padrão vs. em cadeia de pensamento. Todos os experimentos utilizam snapshots de modelos fixos, monitorização de impressão digital do sistema e registo completo para reprodutibilidade.

Tipo de estudo

Observacional

Inscrição (Estimado)

1380

Contactos e Locais

Esta seção fornece os detalhes de contato para aqueles que conduzem o estudo e informações sobre onde este estudo está sendo realizado.

Contato de estudo

  • Nome: Qingli Zhu, MD
  • Número de telefone: +86 13621376699
  • E-mail: zqlpumch@126.com

Estude backup de contato

  • Nome: Yinglan Wu, MD
  • Número de telefone: +86 15626121076
  • E-mail: wuylan7@gmail.com

Locais de estudo

      • Beijing, China, 100730
        • Recrutamento
        • Peking Union Medical College Hospital
        • Contato:

Critérios de participação

Os pesquisadores procuram pessoas que se encaixem em uma determinada descrição, chamada de critérios de elegibilidade. Alguns exemplos desses critérios são a condição geral de saúde de uma pessoa ou tratamentos anteriores.

Critérios de elegibilidade

Idades elegíveis para estudo

  • Adulto
  • Adulto mais velho

Aceita Voluntários Saudáveis

Sim

Método de amostragem

Amostra Não Probabilística

População do estudo

Imagens de ultrassonografia mamária anonimizadas de pacientes adultos que realizaram exame de ultrassonografia mamária no Peking Union Medical College Hospital entre 2018 e 2025 com confirmação patológica subsequente, complementadas por imagens de conjuntos de dados de ultrassonografia mamária de acesso aberto, aprovados eticamente e publicados (por exemplo, BUSI, BrEaST).

Descrição

Critérios de Inclusão:

  • Imagens de ultrassom mamário modo B em escala de cinza da base de dados PACS institucional ou de conjuntos de dados abertos de ultrassom mamário publicados com aprovação ética institucional original documentada
  • Qualidade de imagem adequada para diagnóstico clínico com visualização clara da região de interesse
  • Diagnóstico patológico confirmado (para grupos de lesões benignas e malignas), ou estado mamário normal confirmado por um radiologista sénior com >15 anos de experiência em ultrassom mamário (para o grupo normal)
  • Desidentificação completa com remoção de todas as informações pessoalmente identificáveis

Critérios de Exclusão:

  • Qualidade de imagem severamente degradada impedindo avaliação BI-RADS significativa
  • Imagens duplicadas do mesmo paciente (apenas a imagem mais representativa retida por lesão)
  • Imagens com informações pessoalmente identificáveis residuais após processamento de desidentificação
  • Casos com resultados patológicos ambíguos, contestados ou indisponíveis
  • Imagens de ultrassom não modo B, incluindo elastografia, ultrassom com contraste e imagem Doppler

Plano de estudo

Esta seção fornece detalhes do plano de estudo, incluindo como o estudo é projetado e o que o estudo está medindo.

Como o estudo é projetado?

Detalhes do projeto

Coortes e Intervenções

Grupo / Coorte
Intervenção / Tratamento
Mama Normal
Imagens de ecografia mamária mostrando tecido glandular normal em diferentes tipos de composição tecidual, sem lesões focais identificadas. Confirmado por revisão de radiologista sénior.
Avaliação retrospetiva de imagens de ultrassom da mama desidentificadas por múltiplos sistemas de IA, incluindo modelos de aprendizagem profunda de base (ResNet-50, USFM) e modelos de linguagem grandes multimodais, utilizando prompts padronizados de cadeia de pensamento orientados pelo BI-RADS via API. Nenhum contacto com doentes ou tomada de decisões clínicas está envolvido.
Lesão Benigna
Imagens de ecografia mamária contendo lesões benignas confirmadas patologicamente (BI-RADS 2-4B), incluindo fibroadenoma, quisto, lipoma, adenose esclerosante, papiloma intraductal e lesões não massificadas selecionadas (NML).
Avaliação retrospetiva de imagens de ultrassom da mama desidentificadas por múltiplos sistemas de IA, incluindo modelos de aprendizagem profunda de base (ResNet-50, USFM) e modelos de linguagem grandes multimodais, utilizando prompts padronizados de cadeia de pensamento orientados pelo BI-RADS via API. Nenhum contacto com doentes ou tomada de decisões clínicas está envolvido.
Lesão Maligna
Imagens de ecografia mamária contendo lesões malignas confirmadas patologicamente (BI-RADS 3-5), incluindo carcinoma ductal invasivo, carcinoma lobular invasivo, carcinoma mucinoso e lesões não-massa selecionadas (NML).
Avaliação retrospetiva de imagens de ultrassom da mama desidentificadas por múltiplos sistemas de IA, incluindo modelos de aprendizagem profunda de base (ResNet-50, USFM) e modelos de linguagem grandes multimodais, utilizando prompts padronizados de cadeia de pensamento orientados pelo BI-RADS via API. Nenhum contacto com doentes ou tomada de decisões clínicas está envolvido.

O que o estudo está medindo?

Medidas de resultados primários

Medida de resultado
Descrição da medida
Prazo
Precisão Diagnóstica para Diagnóstico Patológico
Prazo: No final do estudo, aproximadamente 12 meses
Sensibilidade, especificidade, valor preditivo positivo (VPP), valor preditivo negativo (VPN) e pontuação F1 dos modelos de IA para classificação benigna-maligna, com diagnóstico histopatológico como padrão-ouro.
No final do estudo, aproximadamente 12 meses
Precisão da Classificação BI-RADS
Prazo: Ao término do estudo, aproximadamente 12 meses
Precisão global dos modelos de IA na atribuição de categorias BI-RADS (2, 3, 4A, 4B, 4C, 5) a imagens de ecografia mamária, comparada com a anotação de consenso de especialistas como padrão de referência.
Ao término do estudo, aproximadamente 12 meses

Medidas de resultados secundários

Medida de resultado
Descrição da medida
Prazo
Concordância com o Consenso de Especialistas (Kappa de Cohen)
Prazo: No final do estudo, aproximadamente 12 meses
Coeficiente de kappa de Cohen medindo a concordância entre a classificação BI-RADS de cada modelo de IA e a anotação de consenso de especialistas, reportado com intervalos de confiança de 95%.
No final do estudo, aproximadamente 12 meses
Taxa de Rejeição Fora da Distribuição
Prazo: No final do estudo, aproximadamente 12 meses
Proporção de imagens não diagnósticas (qualidade degradada, ultrassonografia não mamária, outras modalidades de imagem) corretamente identificadas e recusadas por modelos de IA, avaliando a segurança de domínio.
No final do estudo, aproximadamente 12 meses
Sensibilidade, Especificidade, VPP, VPN e Pontuação F1
Prazo: No final do estudo, aproximadamente 12 meses
Métricas de desempenho de diagnóstico padrão para classificação benigno-maligno, relatadas para cada modelo de IA individualmente.
No final do estudo, aproximadamente 12 meses

Colaboradores e Investigadores

É aqui que você encontrará pessoas e organizações envolvidas com este estudo.

Patrocinador

Colaboradores

Investigadores

  • Investigador principal: Qingli Zhu, MD, Peking Union Medical College Hospital

Publicações e links úteis

A pessoa responsável por inserir informações sobre o estudo fornece voluntariamente essas publicações. Estes podem ser sobre qualquer coisa relacionada ao estudo.

Publicações Gerais

Datas de registro do estudo

Essas datas acompanham o progresso do registro do estudo e os envios de resumo dos resultados para ClinicalTrials.gov. Os registros do estudo e os resultados relatados são revisados ​​pela National Library of Medicine (NLM) para garantir que atendam aos padrões específicos de controle de qualidade antes de serem publicados no site público.

Datas Principais do Estudo

Início do estudo (Real)

12 de março de 2026

Conclusão Primária (Estimado)

1 de dezembro de 2026

Conclusão do estudo (Estimado)

1 de março de 2027

Datas de inscrição no estudo

Enviado pela primeira vez

24 de março de 2026

Enviado pela primeira vez que atendeu aos critérios de CQ

24 de março de 2026

Primeira postagem (Real)

30 de março de 2026

Atualizações de registro de estudo

Última Atualização Postada (Real)

30 de março de 2026

Última atualização enviada que atendeu aos critérios de controle de qualidade

24 de março de 2026

Última verificação

1 de março de 2026

Mais Informações

Termos relacionados a este estudo

Outros números de identificação do estudo

  • K10349
  • 2024-I2M-CT-B-035 (Número de outro subsídio/financiamento: CAMS Innovation Fund for Medical Sciences)
  • I-26PJ0568 (Outro identificador: Ethics Committee, Peking Union Medical College Hospital)

Plano para dados de participantes individuais (IPD)

Planeja compartilhar dados de participantes individuais (IPD)?

SIM

Descrição do plano IPD

O conjunto de dados de avaliação de referência anonimizado, incluindo imagens de ultrassom da mama anotadas por especialistas com relatórios de leitura BI-RADS emparelhados, está planeado para lançamento público, a fim de promover a reprodutibilidade académica e a investigação colaborativa.

Prazo de Compartilhamento de IPD

Dentro de 6 meses após a publicação primária, disponível indefinidamente

Critérios de acesso de compartilhamento IPD

Acesso aberto através de um repositório de dados reconhecido (a determinar)

Tipo de informação de suporte de compartilhamento de IPD

  • PROTOCOLO DE ESTUDO
  • SEIVA
  • ANALYTIC_CODE

Informações sobre medicamentos e dispositivos, documentos de estudo

Estuda um medicamento regulamentado pela FDA dos EUA

Não

Estuda um produto de dispositivo regulamentado pela FDA dos EUA

Não

Essas informações foram obtidas diretamente do site clinicaltrials.gov sem nenhuma alteração. Se você tiver alguma solicitação para alterar, remover ou atualizar os detalhes do seu estudo, entre em contato com register@clinicaltrials.gov. Assim que uma alteração for implementada em clinicaltrials.gov, ela também será atualizada automaticamente em nosso site .