- ICH GCP
- Amerikanska kliniska prövningsregistret
- Klinisk prövning NCT07500428
Konstruktion av ett riktmärke för AI-tolkning av bröstultraljud och prestandautvärdering av multimodala AI-modeller (BUST-AI Bench)
Utveckling av ett standardiserat riktmärkesutvärderingssystem för intelligent bröstultraljudsbildtolkning och systematisk prestandabedömning av multimodal artificiell intelligensmodeller baserade på ACR BI-RADS v2025-kriterier
Denna enhetscentrerade, retrospektiva, observationsstudie syftar till att konstruera ett standardiserat referensutvärderingssystem för intelligent tolkning av bröstultraljudsbilder och att systematiskt bedöma diagnostiska prestandan hos nuvarande huvudsakliga multimodala artificiella intelligensmodeller (AI).
Avidentifierade B-mode bröstultraljudsbilder med bekräftade patologiska diagnoser kommer att samlas in retrospektivt från institutionsarkivet (2018-2025) och kompletteras med bilder från publicerade öppet tillgängliga dataset. Expertröntgenläkare med varierande erfarenhetsnivåer kommer att oberoende annotera alla bilder enligt American College of Radiology (ACR) Breast Imaging Reporting and Data System (BI-RADS) v2025-kriterierna, inklusive körtelvävnadssammansättning, lesionkarakterisering (massa vs. icke-massalesion), morfologiska deskriptorer och slutlig BI-RADS-klassificering.
Baslinjedeep learning-modeller (CNN-baserad ResNet-50 och Transformer-baserad USFM) kommer att tränas för att etablera prestandabaslinjer och stratifiera fall genom diagnostisk svårighetsgrad via tvärarkitekturkonsensus. Flera multimodala stora språkmodeller (MLLMs), inklusive både allmänna och medicinska domänmodeller, kommer därefter att utvärderas via standardiserade API-anrop med BI-RADS-styrda chain-of-thought-prompts vid temperatur 0 för reproducerbarhet.
Primära slutpunkter inkluderar BI-RADS-klassificeringsnoggrannhet och diagnostisk AUC för godartad-malign differentiering. Modellrobusthet och säkerhet kommer att bedömas genom out-of-distribution-avvisningstestning, temperaturstabilitetsexperiment och tänkesättsablationstudier. Denna studie följer FLAIR och TRIPOD-LLM-rapporteringsriktlinjerna.
Studieöversikt
Status
Betingelser
Intervention / Behandling
Detaljerad beskrivning
Bakgrund: Bröstcancer är den vanligaste maligniteten bland kvinnor världen över. Ultraljud är en förstahands screeningmetod, särskilt i asiatiska populationer med tät bröstvävnad där mammografisk känslighet är begränsad. Tolkning av ultraljud är dock starkt operatörsberoende, med betydande variation mellan observatörer i BI-RADS-klassificering, särskilt för kategorin 4A-4B-läsioner. Multimodala stora språkmodeller (MLLM) har framträtt som ett lovande verktyg för medicinsk bildanalys på grund av deras nollskottsdiagnostiska förmåga, tolkningsbara kedjetänkande och strukturerad rapportgenerering. Ändå finns det för närvarande ingen standardiserad riktmärke för att utvärdera AI-prestanda vid tolkning av bröstultraljud.
Studiedesign: Ungefär 1 380 bröstultraljudsbilder kommer att sammanställas (1 200 utvärderingsuppsättning + 150 säkerhetstestuppsättning utanför distribution + 30 promptutvecklingsuppsättning), omfattande tre diagnostiska kategorier: normal bröstvävnad, godartade läsioner (BI-RADS 2-4B) och maligna läsioner (BI-RADS 3-5). Två junior radiologer (<5 års erfarenhet) och två senior radiologer (>15 år) kommer oberoende att annotera bilder enligt ACR BI-RADS v2025 med skiljedomsförfarande av en femte expert för oense fall.
Diagnostisk svårighetsgrad kommer att stratifieras i tre nivåer med djupinlärningskonsensus över arkitekturer: Nivå 1 (enkel, båda modellerna korrekta), Nivå 2 (tvetydig, en korrekt/en inkorrekt) och Nivå 3 (svår, båda inkorrekta, med senior expertvalidering). MLLM kommer att utvärderas över flera dimensioner: klassificeringsnoggrannhet, känslighet, specificitet, F1-poäng, AUC, Cohens kappa-överensstämmelse med expertkonsensus, förväntat kalibreringsfel (ECE), noggrannhet i morfologisk egenskapsbeskrivning och kvalitet på kedjetänkande.
Säkerhetsbedömning: (1) Test av avvisning utanför distribution med 150 icke-diagnostiska bilder (försämrade bilder, icke-bröstultraljud, andra bildmodaliteter); (2) Temperaturstabilitetspre-experiment över parameterinställningar; (3) Ablation av tänkesätt som jämför standard mot kedjetänkande resoneringslägen. Alla experiment använder fasta modellögonblicksbilder, systemfingeravtrycksövervakning och komplett loggning för reproducerbarhet.
Studietyp
Inskrivning (Beräknad)
Kontakter och platser
Studiekontakt
- Namn: Qingli Zhu, MD
- Telefonnummer: +86 13621376699
- E-post: zqlpumch@126.com
Studera Kontakt Backup
- Namn: Yinglan Wu, MD
- Telefonnummer: +86 15626121076
- E-post: wuylan7@gmail.com
Studieorter
-
-
-
Beijing, Kina, 100730
- Rekrytering
- Peking Union Medical College Hospital
-
Kontakt:
- Qingli Zhu, MD
- Telefonnummer: +86 13621376699
- E-post: zqlpumch@126.com
-
-
Deltagandekriterier
Urvalskriterier
Åldrar som är berättigade till studier
- Vuxen
- Äldre vuxen
Tar emot friska volontärer
Testmetod
Studera befolkning
Beskrivning
Inklusionskriterier:
- B-mode bröstultraljuds gråskalebilder från institutionens PACS-databas eller från publicerade öppet tillgängliga bröstultraljudsdatabaser med dokumenterat ursprungligt institutionellt etiskt godkännande
- Bildkvalitet tillräcklig för klinisk diagnos med tydlig visualisering av intresseområdet
- Patologisk diagnos bekräftad (för godartade och maligna lesionsgrupper), eller normal bröststatus bekräftad av en senior radiolog med >15 års erfarenhet av bröstultraljud (för normalgruppen)
- Fullständig avidentifiering med borttagning av all personligt identifierbar information
Exklusionskriterier:
- Allvarligt försämrad bildkvalitet som hindrar meningsfull BI-RADS-bedömning
- Dubblettbilder från samma patient (endast den mest representativa bilden kvar per lesion)
- Bilder med kvarvarande personligt identifierbar information efter avidentifieringsprocessen
- Fall med tvetydiga, omtvistade eller otillgängliga patologiska resultat
- Icke-B-mode ultraljudsbilder, inklusive elastografi, kontrastförstärkt ultraljud och Doppler-avbildning
Studieplan
Hur är studien utformad?
Designdetaljer
Kohorter och interventioner
Grupp / Kohort |
Intervention / Behandling |
|---|---|
|
Normal Bröst
Brästultraljudsbilder som visar normal körtelvävnad över olika vävnadssammansättningstyper, utan identifierade fokala lesioner.
Bekräftat genom granskning av senior radiolog.
|
Retrospektiv utvärdering av avidentifierade bröstultraljudsbilder av flera AI-system, inklusive baslinjemodeller för djupinlärning (ResNet-50, USFM) och multimodala stora språkmodeller, med standardiserade BI-RADS-styrda kedjor av tankeprompter via API.
Ingen patientkontakt eller kliniskt beslutsfattande är involverat.
|
|
Godartad lesion
Bröstultraljudsbilder som innehåller patologiskt bekräftade godartade lesioner (BI-RADS 2-4B), inklusive fibroadenom, cysta, lipom, skleroserande adenos, intraduktalt papillom och utvalda icke-masslesioner (NML).
|
Retrospektiv utvärdering av avidentifierade bröstultraljudsbilder av flera AI-system, inklusive baslinjemodeller för djupinlärning (ResNet-50, USFM) och multimodala stora språkmodeller, med standardiserade BI-RADS-styrda kedjor av tankeprompter via API.
Ingen patientkontakt eller kliniskt beslutsfattande är involverat.
|
|
Malign lesion
Bröstultraljudsbilder med patologiskt bekräftade maligna lesioner (BI-RADS 3-5), inklusive invasiv duktal karcinom, invasiv lobulär karcinom, mucinöst karcinom och utvalda non-mass lesioner (NML).
|
Retrospektiv utvärdering av avidentifierade bröstultraljudsbilder av flera AI-system, inklusive baslinjemodeller för djupinlärning (ResNet-50, USFM) och multimodala stora språkmodeller, med standardiserade BI-RADS-styrda kedjor av tankeprompter via API.
Ingen patientkontakt eller kliniskt beslutsfattande är involverat.
|
Vad mäter studien?
Primära resultatmått
Resultatmått |
Åtgärdsbeskrivning |
Tidsram |
|---|---|---|
|
Diagnostisk noggrannhet för patologisk diagnos
Tidsram: Vid studiens avslutning, cirka 12 månader
|
Känslighet, specificitet, positivt prediktivt värde (PPV), negativt prediktivt värde (NPV) och F1-poäng för AI-modeller för godartad-elakartad klassificering, med histopatologisk diagnos som guldstandard.
|
Vid studiens avslutning, cirka 12 månader
|
|
BI-RADS-klassificeringens noggrannhet
Tidsram: Vid studiens slutförande, ungefär 12 månader
|
Den övergripande noggrannheten hos AI-modeller i att tilldela BI-RADS-kategorier (2, 3, 4A, 4B, 4C, 5) till bröstultraljudsbilder, jämfört med expertkonsensusannotation som referensstandard.
|
Vid studiens slutförande, ungefär 12 månader
|
Sekundära resultatmått
Resultatmått |
Åtgärdsbeskrivning |
Tidsram |
|---|---|---|
|
Överensstämmelse med expertkonsensus (Cohens kappa)
Tidsram: Vid studiens avslutande, ungefär 12 månader
|
Cohen's kappakoefficient som mäter överensstämmelsen mellan varje AI-modells BI-RADS-klassificering och expertkonsensusannoteringen, rapporterad med 95 % konfidensintervall.
|
Vid studiens avslutande, ungefär 12 månader
|
|
Utfördelning Avvisningsfrekvens
Tidsram: Vid studiens slutförande, cirka 12 månader
|
Andel icke-diagnostiska bilder (försämrad kvalitet, icke-bröstultraljud, andra bildmodaliteter) korrekt identifierade och avvisade av AI-modeller, vilket utvärderar domänsäkerhet.
|
Vid studiens slutförande, cirka 12 månader
|
|
Sensitivitet, Specificitet, PPV, NPV och F1-poäng
Tidsram: Vid studieavslut, cirka 12 månader
|
Standarddiagnostiska prestandamått för godartad-elakartad klassificering, rapporterade för varje AI-modell individuellt.
|
Vid studieavslut, cirka 12 månader
|
Samarbetspartners och utredare
Samarbetspartners
Utredare
- Huvudutredare: Qingli Zhu, MD, Peking Union Medical College Hospital
Publikationer och användbara länkar
Allmänna publikationer
- Sung H, Ferlay J, Siegel RL, Laversanne M, Soerjomataram I, Jemal A, Bray F. Global Cancer Statistics 2020: GLOBOCAN Estimates of Incidence and Mortality Worldwide for 36 Cancers in 185 Countries. CA Cancer J Clin. 2021 May;71(3):209-249. doi: 10.3322/caac.21660. Epub 2021 Feb 4.
- Bi WL, Hosny A, Schabath MB, Giger ML, Birkbak NJ, Mehrtash A, Allison T, Arnaout O, Abbosh C, Dunn IF, Mak RH, Tamimi RM, Tempany CM, Swanton C, Hoffmann U, Schwartz LH, Gillies RJ, Huang RY, Aerts HJWL. Artificial intelligence in cancer imaging: Clinical challenges and applications. CA Cancer J Clin. 2019 Mar;69(2):127-157. doi: 10.3322/caac.21552. Epub 2019 Feb 5.
- Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, Ghassemi M, Liu X, Reitsma JB, van Smeden M, Boulesteix AL, Camaradou JC, Celi LA, Denaxas S, Denniston AK, Glocker B, Golub RM, Harvey H, Heinze G, Hoffman MM, Kengne AP, Lam E, Lee N, Loder EW, Maier-Hein L, Mateen BA, McCradden MD, Oakden-Rayner L, Ordish J, Parnell R, Rose S, Singh K, Wynants L, Logullo P. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024 Apr 16;385:e078378. doi: 10.1136/bmj-2023-078378.
- Benary M, Wang XD, Schmidt M, Soll D, Hilfenhaus G, Nassir M, Sigler C, Knodler M, Keller U, Beule D, Keilholz U, Leser U, Rieke DT. Leveraging Large Language Models for Decision Support in Personalized Oncology. JAMA Netw Open. 2023 Nov 1;6(11):e2343689. doi: 10.1001/jamanetworkopen.2023.43689.
- Bhayana R, Krishna S, Bleakney RR. Performance of ChatGPT on a Radiology Board-style Examination: Insights into Current Strengths and Limitations. Radiology. 2023 Jun;307(5):e230582. doi: 10.1148/radiol.230582. Epub 2023 May 16.
- Clusmann J, Kolbinger FR, Muti HS, Carrero ZI, Eckardt JN, Laleh NG, Loffler CML, Schwarzkopf SC, Unger M, Veldhuizen GP, Wagner SJ, Kather JN. The future landscape of large language models in medicine. Commun Med (Lond). 2023 Oct 10;3(1):141. doi: 10.1038/s43856-023-00370-1.
- Seyyed-Kalantari L, Zhang H, McDermott MBA, Chen IY, Ghassemi M. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021 Dec;27(12):2176-2182. doi: 10.1038/s41591-021-01595-0. Epub 2021 Dec 10.
- Moor M, Banerjee O, Abad ZSH, Krumholz HM, Leskovec J, Topol EJ, Rajpurkar P. Foundation models for generalist medical artificial intelligence. Nature. 2023 Apr;616(7956):259-265. doi: 10.1038/s41586-023-05881-4. Epub 2023 Apr 12.
- Miaojiao S, Xia L, Xian Tao Z, Zhi Liang H, Sheng C, Songsong W. Using a Large Language Model for Breast Imaging Reporting and Data System Classification and Malignancy Prediction to Enhance Breast Ultrasound Diagnosis: Retrospective Study. JMIR Med Inform. 2025 Jun 11;13:e70924. doi: 10.2196/70924.
- Jiao J, Zhou J, Li X, Xia M, Huang Y, Huang L, Wang N, Zhang X, Zhou S, Wang Y, Guo Y. USFM: A universal ultrasound foundation model generalized to tasks and organs towards label efficient image analysis. Med Image Anal. 2024 Aug;96:103202. doi: 10.1016/j.media.2024.103202. Epub 2024 May 15.
- Xiang H, Wang X, Xu M, Zhang Y, Zeng S, Li C, Liu L, Deng T, Tang G, Yan C, Ou J, Lin Q, He J, Sun P, Li A, Chen H, Heng PA, Lin X. Deep Learning-assisted Diagnosis of Breast Lesions on US Images: A Multivendor, Multicenter Study. Radiol Artif Intell. 2023 Jul 12;5(5):e220185. doi: 10.1148/ryai.220185. eCollection 2023 Sep.
- Kottlors J, Iuga AI, Bluethgen C, Bressem K, Kather JN, Moy L, Wald C, Wang W, Liu T, Ranschaert E, Dratsch T, Kleesiek J, Gertz RJ, Rajpurkar P, Bedayat A, Fink MA, Zeeck A, Chaudhari A, Alkasab T, Wu H, Nensa F, Wang B, Grosse Hokamp N, Laukamp KR, Persigehl T, Maintz D, Truhn D, Lennartz S. Guidelines for Reporting Studies on Large Language Models in Radiology: An International Delphi Expert Survey. Radiology. 2026 Feb;318(2):e250913. doi: 10.1148/radiol.250913.
Studieavstämningsdatum
Studera stora datum
Studiestart (Faktisk)
Primärt slutförande (Beräknad)
Avslutad studie (Beräknad)
Studieregistreringsdatum
Först inskickad
Först inskickad som uppfyllde QC-kriterierna
Första postat (Faktisk)
Uppdateringar av studier
Senaste uppdatering publicerad (Faktisk)
Senaste inskickade uppdateringen som uppfyllde QC-kriterierna
Senast verifierad
Mer information
Termer relaterade till denna studie
Nyckelord
Ytterligare relevanta MeSH-villkor
Andra studie-ID-nummer
- K10349
- 2024-I2M-CT-B-035 (Annat bidrag/finansieringsnummer: CAMS Innovation Fund for Medical Sciences)
- I-26PJ0568 (Annan identifierare: Ethics Committee, Peking Union Medical College Hospital)
Plan för individuella deltagardata (IPD)
Planerar du att dela individuella deltagardata (IPD)?
IPD-planbeskrivning
Tidsram för IPD-delning
Kriterier för IPD Sharing Access
IPD-delning som stöder informationstyp
- STUDY_PROTOCOL
- SAV
- ANALYTIC_CODE
Läkemedels- och apparatinformation, studiedokument
Studerar en amerikansk FDA-reglerad läkemedelsprodukt
Studerar en amerikansk FDA-reglerad produktprodukt
Denna information hämtades direkt från webbplatsen clinicaltrials.gov utan några ändringar. Om du har några önskemål om att ändra, ta bort eller uppdatera dina studieuppgifter, vänligen kontakta register@clinicaltrials.gov. Så snart en ändring har implementerats på clinicaltrials.gov, kommer denna att uppdateras automatiskt även på vår webbplats .