Denne siden ble automatisk oversatt og nøyaktigheten av oversettelsen er ikke garantert. Vennligst referer til engelsk versjon for en kildetekst.

Opprettelse av en referansestandard for kunstig intelligens-tolkning av brystultralyd og ytelsesevaluering av multimodale KI-modeller (BUST-AI Bench)

24. mars 2026 oppdatert av: Qingli Zhu, Peking Union Medical College Hospital

Konstruksjon av et standardisert benchmark-evalueringsopplegg for intelligent brystultralyd bildeanalyse og systematisk ytelsesvurdering av multimodale kunstig intelligens-modeller basert på ACR BI-RADS v2025 kriterier

Denne enkelt-senter, retrospektive, observasjonsstudien har som mål å konstruere et standardisert referansesystem for evaluering av intelligent tolkning av brystultralydbilder og å systematisk vurdere diagnostisk ytelse av nåværende hovedstrøms multimodal kunstig intelligens (AI)-modeller.

Anonymiserte B-modus brystultralydbilder med bekreftede patologiske diagnoser vil bli retrospektivt samlet fra institusjonens arkiv (2018-2025) og supplert med bilder fra publiserte åpent tilgjengelige datasett. Ekspertradiologer med ulike erfaringstrinn vil uavhengig merke alle bilder i henhold til American College of Radiology (ACR) Breast Imaging Reporting and Data System (BI-RADS) v2025 kriterier, inkludert kjertelvevsammensetning, lesjonskarakterisering (masse vs. ikke-masse lesjon), morfologiske beskrivelser, og endelig BI-RADS klassifisering.

Grunnleggende dyp læringsmodeller (CNN-baserte ResNet-50 og Transformer-baserte USFM) vil bli trent for å etablere ytelsesbaser og stratifisere saker etter diagnostisk vanskelighetsgrad gjennom tverrarkitektonisk konsensus. Flere multimodal store språkmodeller (MLLMs), inkludert både generelle og medisinsk-domenespesifikke modeller, vil deretter bli evaluert via standardiserte API-kall ved bruk av BI-RADS-guidet tankekjede-påminnelser ved temperatur 0 for reproduserbarhet.

Primære endepunkter inkluderer BI-RADS klassifiseringsnøyaktighet og diagnostisk AUC for godartet-malign differensiering. Modell robusthet og sikkerhet vil bli vurdert gjennom utenfor-distribusjon avvisningstesting, temperatur-stabilitetseksperimenter, og tenkemodus-ablasjonsstudier. Denne studien følger FLAIR og TRIPOD-LLM rapporteringsretningslinjer.

Studieoversikt

Detaljert beskrivelse

Bakgrunn: Brystkreft er den vanligste ondartede svulsten blant kvinner over hele verden. Ultralyd er en førstelinje screeningmodalitet, spesielt i asiatiske befolkninger med tett brystvev hvor mammografisk sensitivitet er begrenset. Imidlertid er ultralydtolkning svært operatøravhengig, med betydelig variasjon mellom observatører i BI-RADS-klassifisering, spesielt for kategoriene 4A-4B-lesjoner. Flermodale store språkmodeller (MLLM-er) har dukket opp som et lovende verktøy for medisinsk bildeanalyse på grunn av deres zero-shot-diagnostiske evne, tolkbar kjede-av-tankeforståelse og strukturert rapportgenerering. Likevel finnes det for øyeblikket ingen standardisert referanse for å evaluere AI-ytelse i brystultralydtolkning.

Studiedesign: Omtrent 1.380 brystultralydbilder vil bli kurert (1.200 evalueringssett + 150 utenfor-distribusjon-sikkerhetstestsett + 30 prompt-utviklingssett), som omfatter tre diagnostiske kategorier: normalt bryst, godartede lesjoner (BI-RADS 2-4B) og ondartede lesjoner (BI-RADS 3-5). To junior radiologer (<5 års erfaring) og to senior radiologer (>15 år) vil uavhengig annotere bilder i henhold til ACR BI-RADS v2025 med voldgift av en femte ekspert for uoverensstemmende tilfeller.

Diagnostisk vanskelighetsgrad vil bli lagdelt i tre nivåer ved bruk av tverrarkitektonisk deep learning-konsensus: Nivå 1 (enkel, begge modeller korrekte), Nivå 2 (tvetydig, én korrekt/én inkorrekt) og Nivå 3 (vanskelig, begge inkorrekte, med senior ekspertvalidering). MLLM-er vil bli evaluert på tvers av flere dimensjoner: klassifiseringsnøyaktighet, sensitivitet, spesifisitet, F1-score, AUC, Cohen's kappa-samstemmighet med ekspertkonsensus, forventet kalibreringsfeil (ECE), morfologisk egenskapsbeskrivelsesnøyaktighet og kjede-av-tankeforståelseskvalitet.

Sikkerhetsvurdering: (1) Utenfor-distribusjon-avvisningstest ved bruk av 150 ikke-diagnostiske bilder (forringede bilder, ikke-brystultralyd, andre bildebehandlingsmodaliteter); (2) Temperaturstabilitetspre-eksperiment på tvers av parameterinnstillinger; (3) Tenkingsmodus-ablasjon som sammenligner standard vs. kjede-av-tankeforståelsesmoduser. Alle eksperimenter bruker faste modell-øyeblikksbilder, systemfingeravtrykksovervåking og fullstendig logging for reproduserbarhet.

Studietype

Observasjonsmessig

Registrering (Antatt)

1380

Kontakter og plasseringer

Denne delen inneholder kontaktinformasjon for de som utfører studien, og informasjon om hvor denne studien blir utført.

Studiekontakt

Studer Kontakt Backup

Studiesteder

      • Beijing, Kina, 100730
        • Rekruttering
        • Peking Union Medical College Hospital
        • Ta kontakt med:

Deltakelseskriterier

Forskere ser etter personer som passer til en bestemt beskrivelse, kalt kvalifikasjonskriterier. Noen eksempler på disse kriteriene er en persons generelle helsetilstand eller tidligere behandlinger.

Kvalifikasjonskriterier

Alder som er kvalifisert for studier

  • Voksen
  • Eldre voksen

Tar imot friske frivillige

Ja

Prøvetakingsmetode

Ikke-sannsynlighetsprøve

Studiepopulasjon

Avidentifiserte brystultralydbilder fra voksne pasienter som gjennomgikk brystultralydundersøkelse ved Peking Union Medical College Hospital mellom 2018 og 2025 med påfølgende patologisk bekreftelse, supplert med bilder fra publiserte, etisk godkjente, åpent tilgjengelige brystultralyddatasett (f.eks. BUSI, BrEaST).

Beskrivelse

Inklusjonskriterier:

  • B-mode brystultralyd gråskalabilder fra institusjonens PACS-database eller fra publiserte åpent tilgjengelige brystultralyd-datasett med dokumentert godkjenning fra den opprinnelige institusjonens etikkkomité
  • Bildekvalitet tilstrekkelig for klinisk diagnose med klar visualisering av interesseområdet
  • Patologisk diagnose bekreftet (for godartede og ondartede lesjonsgrupper), eller normal bryststatus bekreftet av en senior radiolog med >15 års erfaring med brystultralyd (for normalgruppen)
  • Fullstendig anonymisering med fjernelse av all personidentifiserbar informasjon

Eksklusjonskriterier:

  • Alvorlig forringet bildekvalitet som forhindrer meningsfull BI-RADS-vurdering
  • Dupliserte bilder fra samme pasient (kun det mest representative bildet beholdt per lesjon)
  • Bilder med gjenværende personidentifiserbar informasjon etter anonymiseringsbehandling
  • Tilfeller med tvetydige, omstridte eller utilgjengelige patologiske resultater
  • Ikke-B-mode ultralydbilder, inkludert elastografi, kontrastforsterket ultralyd og Doppler-bildeforming

Studieplan

Denne delen gir detaljer om studieplanen, inkludert hvordan studien er utformet og hva studien måler.

Hvordan er studiet utformet?

Designdetaljer

Kohorter og intervensjoner

Gruppe / Kohort
Intervensjon / Behandling
Normal bryst
Brystultralydbilder som viser normalt kjertelvev over ulike vevssammensetningstyper, uten fokale lesjoner identifisert.
Bekreftet av senior radiolog gjennomgang.
Retrospektiv evaluering av de-identifiserte brystultralydbilder av flere KI-systemer, inkludert grunnleggende dyp læringsmodeller (ResNet-50, USFM) og multimodale store språkmodeller, ved bruk av standardiserte BI-RADS-veiledede tankekjede-påminnelser via API. Ingen pasientkontakt eller klinisk beslutningstaking er involvert.
Godartet lesjon
Brystultralydbilder som inneholder patologisk bekreftede godartede lesjoner (BI-RADS 2-4B), inkludert fibroadenom, cyste, lipom, skleroserende adenose, intraduktalt papillom og utvalgte ikke-masse lesjoner (NML).
Retrospektiv evaluering av de-identifiserte brystultralydbilder av flere KI-systemer, inkludert grunnleggende dyp læringsmodeller (ResNet-50, USFM) og multimodale store språkmodeller, ved bruk av standardiserte BI-RADS-veiledede tankekjede-påminnelser via API. Ingen pasientkontakt eller klinisk beslutningstaking er involvert.
Malign Lesjon
Brystultralydbilder som inneholder patologisk bekreftede maligne lesjoner (BI-RADS 3-5), inkludert invasiv duktal karsinom, invasiv lobulær karsinom, mucinøst karsinom og utvalgte ikke-masse lesjoner (NML).
Retrospektiv evaluering av de-identifiserte brystultralydbilder av flere KI-systemer, inkludert grunnleggende dyp læringsmodeller (ResNet-50, USFM) og multimodale store språkmodeller, ved bruk av standardiserte BI-RADS-veiledede tankekjede-påminnelser via API. Ingen pasientkontakt eller klinisk beslutningstaking er involvert.

Hva måler studien?

Primære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
Diagnostisk nøyaktighet for patologisk diagnose
Tidsramme: Ved studieavslutning, omtrent 12 måneder
Sensitivitet, spesifisitet, positiv prediktiv verdi (PPV), negativ prediktiv verdi (NPV) og F1-score for AI-modeller for godartet-malign klassifisering, med histopatologisk diagnose som gullstandard.
Ved studieavslutning, omtrent 12 måneder
Nøyaktighet av BI-RADS-klassifisering
Tidsramme: Ved studiens fullføring, omtrent 12 måneder
Den samlede nøyaktigheten til AI-modeller i tilordning av BI-RADS-kategorier (2, 3, 4A, 4B, 4C, 5) til ultralydbilder av brystet, sammenlignet med ekspertkonsensus-annotasjon som referansestandard.
Ved studiens fullføring, omtrent 12 måneder

Sekundære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
Enighet med ekspertkonsensus (Cohens kappa)
Tidsramme: Ved studiens fullføring, omtrent 12 måneder
Cohens kappa-koeffisient som måler samsvar mellom hver AI-modells BI-RADS-klassifisering og ekspertkonsensusannotasjonen, rapportert med 95 % konfidensintervaller.
Ved studiens fullføring, omtrent 12 måneder
Rate for Avvisning utenfor Distribusjon
Tidsramme: Ved studiens avslutning, omtrent 12 måneder
Andel ikke-diagnostiske bilder (forringet kvalitet, ikke-bryst ultralyd, andre bildeformer) korrekt identifisert og avvist av AI-modeller, som evaluerer domene-sikkerhet.
Ved studiens avslutning, omtrent 12 måneder
Sensitivitet, Spesifisitet, PPV, NPV og F1-score
Tidsramme: Ved studiens fullføring, omtrent 12 måneder
Standard diagnostiske ytelsesmål for klassifisering av godartet-kreftsvulst, rapportert for hver KI-modell individuelt.
Ved studiens fullføring, omtrent 12 måneder

Samarbeidspartnere og etterforskere

Det er her du vil finne personer og organisasjoner som er involvert i denne studien.

Etterforskere

  • Hovedetterforsker: Qingli Zhu, MD, Peking Union Medical College Hospital

Publikasjoner og nyttige lenker

Den som er ansvarlig for å legge inn informasjon om studien leverer frivillig disse publikasjonene. Disse kan handle om alt relatert til studiet.

Generelle publikasjoner

Studierekorddatoer

Disse datoene sporer fremdriften for innsending av studieposter og sammendragsresultater til ClinicalTrials.gov. Studieposter og rapporterte resultater gjennomgås av National Library of Medicine (NLM) for å sikre at de oppfyller spesifikke kvalitetskontrollstandarder før de legges ut på det offentlige nettstedet.

Studer hoveddatoer

Studiestart (Faktiske)

12. mars 2026

Primær fullføring (Antatt)

1. desember 2026

Studiet fullført (Antatt)

1. mars 2027

Datoer for studieregistrering

Først innsendt

24. mars 2026

Først innsendt som oppfylte QC-kriteriene

24. mars 2026

Først lagt ut (Faktiske)

30. mars 2026

Oppdateringer av studieposter

Sist oppdatering lagt ut (Faktiske)

30. mars 2026

Siste oppdatering sendt inn som oppfylte QC-kriteriene

24. mars 2026

Sist bekreftet

1. mars 2026

Mer informasjon

Begreper knyttet til denne studien

Andre studie-ID-numre

  • K10349
  • 2024-I2M-CT-B-035 (Annet stipend/finansieringsnummer: CAMS Innovation Fund for Medical Sciences)
  • I-26PJ0568 (Annen identifikator: Ethics Committee, Peking Union Medical College Hospital)

Plan for individuelle deltakerdata (IPD)

Planlegger du å dele individuelle deltakerdata (IPD)?

JA

IPD-planbeskrivelse

Den anonymiserte referansedatasettet, inkludert ekspertkommenterte brystultralydbilder med tilhørende BI-RADS-leserapporter, er planlagt utgitt offentlig for å fremme akademisk reproduserbarhet og samarbeidsforskning.

IPD-delingstidsramme

Innen 6 måneder etter primærpublisering, tilgjengelig på ubestemt tid

Tilgangskriterier for IPD-deling

Åpen tilgang via et anerkjent datalager (som skal fastsettes)

IPD-deling Støtteinformasjonstype

  • STUDY_PROTOCOL
  • SEVJE
  • ANALYTIC_CODE

Legemiddel- og utstyrsinformasjon, studiedokumenter

Studerer et amerikansk FDA-regulert medikamentprodukt

Nei

Studerer et amerikansk FDA-regulert enhetsprodukt

Nei

Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .

Abonnere