- ICH GCP
- US Clinical Trials Registry
- Klinisk utprøving NCT07500428
Opprettelse av en referansestandard for kunstig intelligens-tolkning av brystultralyd og ytelsesevaluering av multimodale KI-modeller (BUST-AI Bench)
Konstruksjon av et standardisert benchmark-evalueringsopplegg for intelligent brystultralyd bildeanalyse og systematisk ytelsesvurdering av multimodale kunstig intelligens-modeller basert på ACR BI-RADS v2025 kriterier
Denne enkelt-senter, retrospektive, observasjonsstudien har som mål å konstruere et standardisert referansesystem for evaluering av intelligent tolkning av brystultralydbilder og å systematisk vurdere diagnostisk ytelse av nåværende hovedstrøms multimodal kunstig intelligens (AI)-modeller.
Anonymiserte B-modus brystultralydbilder med bekreftede patologiske diagnoser vil bli retrospektivt samlet fra institusjonens arkiv (2018-2025) og supplert med bilder fra publiserte åpent tilgjengelige datasett. Ekspertradiologer med ulike erfaringstrinn vil uavhengig merke alle bilder i henhold til American College of Radiology (ACR) Breast Imaging Reporting and Data System (BI-RADS) v2025 kriterier, inkludert kjertelvevsammensetning, lesjonskarakterisering (masse vs. ikke-masse lesjon), morfologiske beskrivelser, og endelig BI-RADS klassifisering.
Grunnleggende dyp læringsmodeller (CNN-baserte ResNet-50 og Transformer-baserte USFM) vil bli trent for å etablere ytelsesbaser og stratifisere saker etter diagnostisk vanskelighetsgrad gjennom tverrarkitektonisk konsensus. Flere multimodal store språkmodeller (MLLMs), inkludert både generelle og medisinsk-domenespesifikke modeller, vil deretter bli evaluert via standardiserte API-kall ved bruk av BI-RADS-guidet tankekjede-påminnelser ved temperatur 0 for reproduserbarhet.
Primære endepunkter inkluderer BI-RADS klassifiseringsnøyaktighet og diagnostisk AUC for godartet-malign differensiering. Modell robusthet og sikkerhet vil bli vurdert gjennom utenfor-distribusjon avvisningstesting, temperatur-stabilitetseksperimenter, og tenkemodus-ablasjonsstudier. Denne studien følger FLAIR og TRIPOD-LLM rapporteringsretningslinjer.
Studieoversikt
Status
Forhold
Intervensjon / Behandling
Detaljert beskrivelse
Bakgrunn: Brystkreft er den vanligste ondartede svulsten blant kvinner over hele verden. Ultralyd er en førstelinje screeningmodalitet, spesielt i asiatiske befolkninger med tett brystvev hvor mammografisk sensitivitet er begrenset. Imidlertid er ultralydtolkning svært operatøravhengig, med betydelig variasjon mellom observatører i BI-RADS-klassifisering, spesielt for kategoriene 4A-4B-lesjoner. Flermodale store språkmodeller (MLLM-er) har dukket opp som et lovende verktøy for medisinsk bildeanalyse på grunn av deres zero-shot-diagnostiske evne, tolkbar kjede-av-tankeforståelse og strukturert rapportgenerering. Likevel finnes det for øyeblikket ingen standardisert referanse for å evaluere AI-ytelse i brystultralydtolkning.
Studiedesign: Omtrent 1.380 brystultralydbilder vil bli kurert (1.200 evalueringssett + 150 utenfor-distribusjon-sikkerhetstestsett + 30 prompt-utviklingssett), som omfatter tre diagnostiske kategorier: normalt bryst, godartede lesjoner (BI-RADS 2-4B) og ondartede lesjoner (BI-RADS 3-5). To junior radiologer (<5 års erfaring) og to senior radiologer (>15 år) vil uavhengig annotere bilder i henhold til ACR BI-RADS v2025 med voldgift av en femte ekspert for uoverensstemmende tilfeller.
Diagnostisk vanskelighetsgrad vil bli lagdelt i tre nivåer ved bruk av tverrarkitektonisk deep learning-konsensus: Nivå 1 (enkel, begge modeller korrekte), Nivå 2 (tvetydig, én korrekt/én inkorrekt) og Nivå 3 (vanskelig, begge inkorrekte, med senior ekspertvalidering). MLLM-er vil bli evaluert på tvers av flere dimensjoner: klassifiseringsnøyaktighet, sensitivitet, spesifisitet, F1-score, AUC, Cohen's kappa-samstemmighet med ekspertkonsensus, forventet kalibreringsfeil (ECE), morfologisk egenskapsbeskrivelsesnøyaktighet og kjede-av-tankeforståelseskvalitet.
Sikkerhetsvurdering: (1) Utenfor-distribusjon-avvisningstest ved bruk av 150 ikke-diagnostiske bilder (forringede bilder, ikke-brystultralyd, andre bildebehandlingsmodaliteter); (2) Temperaturstabilitetspre-eksperiment på tvers av parameterinnstillinger; (3) Tenkingsmodus-ablasjon som sammenligner standard vs. kjede-av-tankeforståelsesmoduser. Alle eksperimenter bruker faste modell-øyeblikksbilder, systemfingeravtrykksovervåking og fullstendig logging for reproduserbarhet.
Studietype
Registrering (Antatt)
Kontakter og plasseringer
Studiekontakt
- Navn: Qingli Zhu, MD
- Telefonnummer: +86 13621376699
- E-post: zqlpumch@126.com
Studer Kontakt Backup
- Navn: Yinglan Wu, MD
- Telefonnummer: +86 15626121076
- E-post: wuylan7@gmail.com
Studiesteder
-
-
-
Beijing, Kina, 100730
- Rekruttering
- Peking Union Medical College Hospital
-
Ta kontakt med:
- Qingli Zhu, MD
- Telefonnummer: +86 13621376699
- E-post: zqlpumch@126.com
-
-
Deltakelseskriterier
Kvalifikasjonskriterier
Alder som er kvalifisert for studier
- Voksen
- Eldre voksen
Tar imot friske frivillige
Prøvetakingsmetode
Studiepopulasjon
Beskrivelse
Inklusjonskriterier:
- B-mode brystultralyd gråskalabilder fra institusjonens PACS-database eller fra publiserte åpent tilgjengelige brystultralyd-datasett med dokumentert godkjenning fra den opprinnelige institusjonens etikkkomité
- Bildekvalitet tilstrekkelig for klinisk diagnose med klar visualisering av interesseområdet
- Patologisk diagnose bekreftet (for godartede og ondartede lesjonsgrupper), eller normal bryststatus bekreftet av en senior radiolog med >15 års erfaring med brystultralyd (for normalgruppen)
- Fullstendig anonymisering med fjernelse av all personidentifiserbar informasjon
Eksklusjonskriterier:
- Alvorlig forringet bildekvalitet som forhindrer meningsfull BI-RADS-vurdering
- Dupliserte bilder fra samme pasient (kun det mest representative bildet beholdt per lesjon)
- Bilder med gjenværende personidentifiserbar informasjon etter anonymiseringsbehandling
- Tilfeller med tvetydige, omstridte eller utilgjengelige patologiske resultater
- Ikke-B-mode ultralydbilder, inkludert elastografi, kontrastforsterket ultralyd og Doppler-bildeforming
Studieplan
Hvordan er studiet utformet?
Designdetaljer
Kohorter og intervensjoner
Gruppe / Kohort |
Intervensjon / Behandling |
|---|---|
|
Normal bryst
Brystultralydbilder som viser normalt kjertelvev over ulike vevssammensetningstyper, uten fokale lesjoner identifisert.
Bekreftet av senior radiolog gjennomgang. |
Retrospektiv evaluering av de-identifiserte brystultralydbilder av flere KI-systemer, inkludert grunnleggende dyp læringsmodeller (ResNet-50, USFM) og multimodale store språkmodeller, ved bruk av standardiserte BI-RADS-veiledede tankekjede-påminnelser via API.
Ingen pasientkontakt eller klinisk beslutningstaking er involvert.
|
|
Godartet lesjon
Brystultralydbilder som inneholder patologisk bekreftede godartede lesjoner (BI-RADS 2-4B), inkludert fibroadenom, cyste, lipom, skleroserende adenose, intraduktalt papillom og utvalgte ikke-masse lesjoner (NML).
|
Retrospektiv evaluering av de-identifiserte brystultralydbilder av flere KI-systemer, inkludert grunnleggende dyp læringsmodeller (ResNet-50, USFM) og multimodale store språkmodeller, ved bruk av standardiserte BI-RADS-veiledede tankekjede-påminnelser via API.
Ingen pasientkontakt eller klinisk beslutningstaking er involvert.
|
|
Malign Lesjon
Brystultralydbilder som inneholder patologisk bekreftede maligne lesjoner (BI-RADS 3-5), inkludert invasiv duktal karsinom, invasiv lobulær karsinom, mucinøst karsinom og utvalgte ikke-masse lesjoner (NML).
|
Retrospektiv evaluering av de-identifiserte brystultralydbilder av flere KI-systemer, inkludert grunnleggende dyp læringsmodeller (ResNet-50, USFM) og multimodale store språkmodeller, ved bruk av standardiserte BI-RADS-veiledede tankekjede-påminnelser via API.
Ingen pasientkontakt eller klinisk beslutningstaking er involvert.
|
Hva måler studien?
Primære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
Diagnostisk nøyaktighet for patologisk diagnose
Tidsramme: Ved studieavslutning, omtrent 12 måneder
|
Sensitivitet, spesifisitet, positiv prediktiv verdi (PPV), negativ prediktiv verdi (NPV) og F1-score for AI-modeller for godartet-malign klassifisering, med histopatologisk diagnose som gullstandard.
|
Ved studieavslutning, omtrent 12 måneder
|
|
Nøyaktighet av BI-RADS-klassifisering
Tidsramme: Ved studiens fullføring, omtrent 12 måneder
|
Den samlede nøyaktigheten til AI-modeller i tilordning av BI-RADS-kategorier (2, 3, 4A, 4B, 4C, 5) til ultralydbilder av brystet, sammenlignet med ekspertkonsensus-annotasjon som referansestandard.
|
Ved studiens fullføring, omtrent 12 måneder
|
Sekundære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
Enighet med ekspertkonsensus (Cohens kappa)
Tidsramme: Ved studiens fullføring, omtrent 12 måneder
|
Cohens kappa-koeffisient som måler samsvar mellom hver AI-modells BI-RADS-klassifisering og ekspertkonsensusannotasjonen, rapportert med 95 % konfidensintervaller.
|
Ved studiens fullføring, omtrent 12 måneder
|
|
Rate for Avvisning utenfor Distribusjon
Tidsramme: Ved studiens avslutning, omtrent 12 måneder
|
Andel ikke-diagnostiske bilder (forringet kvalitet, ikke-bryst ultralyd, andre bildeformer) korrekt identifisert og avvist av AI-modeller, som evaluerer domene-sikkerhet.
|
Ved studiens avslutning, omtrent 12 måneder
|
|
Sensitivitet, Spesifisitet, PPV, NPV og F1-score
Tidsramme: Ved studiens fullføring, omtrent 12 måneder
|
Standard diagnostiske ytelsesmål for klassifisering av godartet-kreftsvulst, rapportert for hver KI-modell individuelt.
|
Ved studiens fullføring, omtrent 12 måneder
|
Samarbeidspartnere og etterforskere
Samarbeidspartnere
Etterforskere
- Hovedetterforsker: Qingli Zhu, MD, Peking Union Medical College Hospital
Publikasjoner og nyttige lenker
Generelle publikasjoner
- Sung H, Ferlay J, Siegel RL, Laversanne M, Soerjomataram I, Jemal A, Bray F. Global Cancer Statistics 2020: GLOBOCAN Estimates of Incidence and Mortality Worldwide for 36 Cancers in 185 Countries. CA Cancer J Clin. 2021 May;71(3):209-249. doi: 10.3322/caac.21660. Epub 2021 Feb 4.
- Bi WL, Hosny A, Schabath MB, Giger ML, Birkbak NJ, Mehrtash A, Allison T, Arnaout O, Abbosh C, Dunn IF, Mak RH, Tamimi RM, Tempany CM, Swanton C, Hoffmann U, Schwartz LH, Gillies RJ, Huang RY, Aerts HJWL. Artificial intelligence in cancer imaging: Clinical challenges and applications. CA Cancer J Clin. 2019 Mar;69(2):127-157. doi: 10.3322/caac.21552. Epub 2019 Feb 5.
- Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, Ghassemi M, Liu X, Reitsma JB, van Smeden M, Boulesteix AL, Camaradou JC, Celi LA, Denaxas S, Denniston AK, Glocker B, Golub RM, Harvey H, Heinze G, Hoffman MM, Kengne AP, Lam E, Lee N, Loder EW, Maier-Hein L, Mateen BA, McCradden MD, Oakden-Rayner L, Ordish J, Parnell R, Rose S, Singh K, Wynants L, Logullo P. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024 Apr 16;385:e078378. doi: 10.1136/bmj-2023-078378.
- Benary M, Wang XD, Schmidt M, Soll D, Hilfenhaus G, Nassir M, Sigler C, Knodler M, Keller U, Beule D, Keilholz U, Leser U, Rieke DT. Leveraging Large Language Models for Decision Support in Personalized Oncology. JAMA Netw Open. 2023 Nov 1;6(11):e2343689. doi: 10.1001/jamanetworkopen.2023.43689.
- Bhayana R, Krishna S, Bleakney RR. Performance of ChatGPT on a Radiology Board-style Examination: Insights into Current Strengths and Limitations. Radiology. 2023 Jun;307(5):e230582. doi: 10.1148/radiol.230582. Epub 2023 May 16.
- Clusmann J, Kolbinger FR, Muti HS, Carrero ZI, Eckardt JN, Laleh NG, Loffler CML, Schwarzkopf SC, Unger M, Veldhuizen GP, Wagner SJ, Kather JN. The future landscape of large language models in medicine. Commun Med (Lond). 2023 Oct 10;3(1):141. doi: 10.1038/s43856-023-00370-1.
- Seyyed-Kalantari L, Zhang H, McDermott MBA, Chen IY, Ghassemi M. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021 Dec;27(12):2176-2182. doi: 10.1038/s41591-021-01595-0. Epub 2021 Dec 10.
- Moor M, Banerjee O, Abad ZSH, Krumholz HM, Leskovec J, Topol EJ, Rajpurkar P. Foundation models for generalist medical artificial intelligence. Nature. 2023 Apr;616(7956):259-265. doi: 10.1038/s41586-023-05881-4. Epub 2023 Apr 12.
- Miaojiao S, Xia L, Xian Tao Z, Zhi Liang H, Sheng C, Songsong W. Using a Large Language Model for Breast Imaging Reporting and Data System Classification and Malignancy Prediction to Enhance Breast Ultrasound Diagnosis: Retrospective Study. JMIR Med Inform. 2025 Jun 11;13:e70924. doi: 10.2196/70924.
- Jiao J, Zhou J, Li X, Xia M, Huang Y, Huang L, Wang N, Zhang X, Zhou S, Wang Y, Guo Y. USFM: A universal ultrasound foundation model generalized to tasks and organs towards label efficient image analysis. Med Image Anal. 2024 Aug;96:103202. doi: 10.1016/j.media.2024.103202. Epub 2024 May 15.
- Xiang H, Wang X, Xu M, Zhang Y, Zeng S, Li C, Liu L, Deng T, Tang G, Yan C, Ou J, Lin Q, He J, Sun P, Li A, Chen H, Heng PA, Lin X. Deep Learning-assisted Diagnosis of Breast Lesions on US Images: A Multivendor, Multicenter Study. Radiol Artif Intell. 2023 Jul 12;5(5):e220185. doi: 10.1148/ryai.220185. eCollection 2023 Sep.
- Kottlors J, Iuga AI, Bluethgen C, Bressem K, Kather JN, Moy L, Wald C, Wang W, Liu T, Ranschaert E, Dratsch T, Kleesiek J, Gertz RJ, Rajpurkar P, Bedayat A, Fink MA, Zeeck A, Chaudhari A, Alkasab T, Wu H, Nensa F, Wang B, Grosse Hokamp N, Laukamp KR, Persigehl T, Maintz D, Truhn D, Lennartz S. Guidelines for Reporting Studies on Large Language Models in Radiology: An International Delphi Expert Survey. Radiology. 2026 Feb;318(2):e250913. doi: 10.1148/radiol.250913.
Studierekorddatoer
Studer hoveddatoer
Studiestart (Faktiske)
Primær fullføring (Antatt)
Studiet fullført (Antatt)
Datoer for studieregistrering
Først innsendt
Først innsendt som oppfylte QC-kriteriene
Først lagt ut (Faktiske)
Oppdateringer av studieposter
Sist oppdatering lagt ut (Faktiske)
Siste oppdatering sendt inn som oppfylte QC-kriteriene
Sist bekreftet
Mer informasjon
Begreper knyttet til denne studien
Nøkkelord
Ytterligere relevante MeSH-vilkår
Andre studie-ID-numre
- K10349
- 2024-I2M-CT-B-035 (Annet stipend/finansieringsnummer: CAMS Innovation Fund for Medical Sciences)
- I-26PJ0568 (Annen identifikator: Ethics Committee, Peking Union Medical College Hospital)
Plan for individuelle deltakerdata (IPD)
Planlegger du å dele individuelle deltakerdata (IPD)?
IPD-planbeskrivelse
IPD-delingstidsramme
Tilgangskriterier for IPD-deling
IPD-deling Støtteinformasjonstype
- STUDY_PROTOCOL
- SEVJE
- ANALYTIC_CODE
Legemiddel- og utstyrsinformasjon, studiedokumenter
Studerer et amerikansk FDA-regulert medikamentprodukt
Studerer et amerikansk FDA-regulert enhetsprodukt
Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .