- ICH GCP
- Register voor klinische proeven in de VS.
- Klinische proef NCT07500428
Constructie van een Benchmark voor Kunstmatige Intelligentie-interpretatie van Borst-echografie en Prestatie-evaluatie van Multimodale AI-modellen (BUST-AI Bench)
Constructie van een Gestandaardiseerd Benchmark Evaluatiesysteem voor Intelligente Interpretatie van Borst-echografiebeelden en Systematische Prestatiebeoordeling van Multimodale Kunstmatige Intelligentiemodellen Gebaseerd op ACR BI-RADS v2025 Criteria
Deze single-center, retrospectieve, observationele studie heeft als doel een gestandaardiseerd benchmark-evaluatiesysteem op te zetten voor intelligente interpretatie van borstechografiebeelden en om de diagnostische prestaties van huidige mainstream multimodale kunstmatige intelligentie (AI) modellen systematisch te beoordelen.
Geanonimiseerde B-mode borstechografiebeelden met bevestigde pathologische diagnoses zullen retrospectief worden verzameld uit het institutionele archief (2018-2025) en aangevuld met beelden uit gepubliceerde open-access datasets. Expert-radiologen met verschillende ervaringsniveaus zullen alle beelden onafhankelijk annoteren volgens de American College of Radiology (ACR) Breast Imaging Reporting and Data System (BI-RADS) v2025 criteria, inclusief klierweefselsamenstelling, laesiekarakterisering (massa versus niet-massa laesie), morfologische beschrijvers en de definitieve BI-RADS-classificatie.
Baseline deep learning modellen (CNN-gebaseerde ResNet-50 en Transformer-gebaseerde USFM) zullen worden getraind om prestatiebaselines vast te stellen en gevallen te stratificeren op diagnostische moeilijkheidsgraad door cross-architectuur consensus. Verschillende multimodale large language modellen (MLLMs), inclusief zowel algemene als medische domeinmodellen, zullen vervolgens worden geëvalueerd via gestandaardiseerde API-aanroepen met BI-RADS-gestuurde chain-of-thought prompts bij temperatuur 0 voor reproduceerbaarheid.
Primaire eindpunten omvatten BI-RADS-classificatienauwkeurigheid en diagnostische AUC voor goedaardig-kwaadaardig onderscheid. Modelrobuustheid en veiligheid zullen worden beoordeeld door out-of-distribution rejectietesten, temperatuur-stabiliteitsexperimenten en thinking-mode ablatiestudies. Deze studie houdt zich aan de FLAIR en TRIPOD-LLM rapportage richtlijnen.
Studie Overzicht
Toestand
Conditie
Interventie / Behandeling
Gedetailleerde beschrijving
Achtergrond: Borstkanker is de meest voorkomende maligniteit bij vrouwen wereldwijd. Echografie is een eerstelijns screeningsmodaliteit, vooral bij Aziatische populaties met dicht borstweefsel waar de mammografische gevoeligheid beperkt is. Echter, de interpretatie van echografie is sterk operatorafhankelijk, met aanzienlijke inter-observer variabiliteit in BI-RADS classificatie, met name voor categorie 4A-4B laesies. Multimodale grote taalmodellen (MLLM's) zijn naar voren gekomen als een veelbelovend hulpmiddel voor medische beeldanalyse vanwege hun zero-shot diagnostische capaciteit, interpreteerbare keten-van-gedachte redenering, en gestructureerde rapportgeneratie. Desalniettemin is er momenteel geen gestandaardiseerde benchmark voor het evalueren van AI-prestaties in borst-echografie interpretatie.
Studieopzet: Ongeveer 1.380 borst-echografiebeelden zullen worden samengesteld (1.200 evaluatieset + 150 out-of-distribution veiligheidstestset + 30 prompt-ontwikkelingsset), omvattende drie diagnostische categorieën: normale borst, goedaardige laesies (BI-RADS 2-4B), en kwaadaardige laesies (BI-RADS 3-5). Twee junior radiologen (<5 jaar ervaring) en twee senior radiologen (>15 jaar) zullen onafhankelijk beelden annoteren volgens ACR BI-RADS v2025 met arbitrage door een vijfde expert voor niet-overeenstemmende gevallen.
Diagnostische moeilijkheid zal worden gestratificeerd in drie lagen met behulp van cross-architectuur deep learning consensus: Laag 1 (eenvoudig, beide modellen correct), Laag 2 (dubbelzinnig, één correct/één incorrect), en Laag 3 (moeilijk, beide incorrect, met senior expert validatie). MLLM's zullen worden geëvalueerd over meerdere dimensies: classificatie nauwkeurigheid, sensitiviteit, specificiteit, F1-score, AUC, Cohen's kappa overeenstemming met expert consensus, verwachte kalibratiefout (ECE), morfologische kenmerkbeschrijving nauwkeurigheid, en keten-van-gedachte redeneerkwaliteit.
Veiligheidsbeoordeling: (1) Out-of-distribution afwijzingstest met 150 niet-diagnostische beelden (gedegradeerde beelden, niet-borst echografie, andere beeldvormingsmodaliteiten); (2) Temperatuur-stabiliteit pre-experiment over parameterinstellingen; (3) Denkmodus-ablatie vergelijkend standaard vs. keten-van-gedachte redeneermodi. Alle experimenten gebruiken vaste model snapshots, systeem vingerafdruk monitoring, en volledige logging voor reproduceerbaarheid.
Studietype
Inschrijving (Geschat)
Contacten en locaties
Studiecontact
- Naam: Qingli Zhu, MD
- Telefoonnummer: +86 13621376699
- E-mail: zqlpumch@126.com
Studie Contact Back-up
- Naam: Yinglan Wu, MD
- Telefoonnummer: +86 15626121076
- E-mail: wuylan7@gmail.com
Studie Locaties
-
-
-
Beijing, China, 100730
- Werving
- Peking Union Medical College Hospital
-
Contact:
- Qingli Zhu, MD
- Telefoonnummer: +86 13621376699
- E-mail: zqlpumch@126.com
-
-
Deelname Criteria
Geschiktheidscriteria
Leeftijden die in aanmerking komen voor studie
- Volwassen
- Oudere volwassene
Accepteert gezonde vrijwilligers
Bemonsteringsmethode
Studie Bevolking
Beschrijving
Inclusiecriteria:
- B-mode borstechografie grijswaardenbeelden uit de institutionele PACS-database of uit gepubliceerde open-access borstechografie datasets met gedocumenteerde originele institutionele ethische goedkeuring
- Beeldkwaliteit voldoende voor klinische diagnose met duidelijke visualisatie van het gebied van belang
- Pathologische diagnose bevestigd (voor goedaardige en kwaadaardige letselgroepen), of normale borststatus bevestigd door een senior radioloog met >15 jaar borstechografie ervaring (voor de normale groep)
- Volledige de-identificatie met verwijdering van alle persoonlijk identificeerbare informatie
Exclusiecriteria:
- Ernstig aangetaste beeldkwaliteit die betekenisvolle BI-RADS-beoordeling verhindert
- Dubbele beelden van dezelfde patiënt (alleen het meest representatieve beeld per letsel behouden)
- Beelden met resterende persoonlijk identificeerbare informatie na de-identificatieverwerking
- Gevallen met dubbelzinnige, betwiste of niet beschikbare pathologische resultaten
- Niet-B-mode echografiebeelden, inclusief elastografie, contrast-verbeterde echografie en Doppler-beeldvorming
Studie plan
Hoe is de studie opgezet?
Ontwerpdetails
Cohorten en interventies
Groep / Cohort |
Interventie / Behandeling |
|---|---|
|
Normale Borst
Borstecho-afbeeldingen die normaal klierweefsel tonen bij verschillende weefselsamenstellingstypen, zonder focale laesies geïdentificeerd.
Bevestigd door beoordeling van senior radioloog.
|
Retrospectieve evaluatie van geanonimiseerde borst-echografiebeelden door meerdere AI-systemen, waaronder baseline deep learning-modellen (ResNet-50, USFM) en multimodale grote taalmodellen, met behulp van gestandaardiseerde BI-RADS-gestuurde chain-of-thought-prompts via API.
Er is geen patiëntcontact of klinische besluitvorming betrokken.
|
|
Goedaardige Laesie
Borst-echografiebeelden met pathologisch bevestigde goedaardige laesies (BI-RADS 2-4B), waaronder fibroadenoom, cyste, lipoom, scleroserende adenose, intraductaal papilloom en geselecteerde niet-massa-laesies (NML).
|
Retrospectieve evaluatie van geanonimiseerde borst-echografiebeelden door meerdere AI-systemen, waaronder baseline deep learning-modellen (ResNet-50, USFM) en multimodale grote taalmodellen, met behulp van gestandaardiseerde BI-RADS-gestuurde chain-of-thought-prompts via API.
Er is geen patiëntcontact of klinische besluitvorming betrokken.
|
|
Kwaadaardige Laesie
Borstecho-afbeeldingen met pathologisch bevestigde maligne laesies (BI-RADS 3-5), waaronder invasief ductaal carcinoom, invasief lobulair carcinoom, mucineus carcinoom en geselecteerde non-mass laesies (NML).
|
Retrospectieve evaluatie van geanonimiseerde borst-echografiebeelden door meerdere AI-systemen, waaronder baseline deep learning-modellen (ResNet-50, USFM) en multimodale grote taalmodellen, met behulp van gestandaardiseerde BI-RADS-gestuurde chain-of-thought-prompts via API.
Er is geen patiëntcontact of klinische besluitvorming betrokken.
|
Wat meet het onderzoek?
Primaire uitkomstmaten
Uitkomstmaat |
Maatregel Beschrijving |
Tijdsspanne |
|---|---|---|
|
Diagnostische nauwkeurigheid voor pathologische diagnose
Tijdsspanne: Na afloop van de studie, ongeveer 12 maanden
|
Gevoeligheid, specificiteit, positief voorspellende waarde (PPV), negatief voorspellende waarde (NPV) en F1-score van AI-modellen voor goedaardig-kwaadaardige classificatie, met histopathologische diagnose als gouden standaard.
|
Na afloop van de studie, ongeveer 12 maanden
|
|
BI-RADS Classificatienauwkeurigheid
Tijdsspanne: Aan het einde van de studie, ongeveer 12 maanden
|
Algehele nauwkeurigheid van AI-modellen bij het toekennen van BI-RADS-categorieën (2, 3, 4A, 4B, 4C, 5) aan borst-echografiebeelden, vergeleken met expertconsensusannotatie als de referentiestandaard.
|
Aan het einde van de studie, ongeveer 12 maanden
|
Secundaire uitkomstmaten
Uitkomstmaat |
Maatregel Beschrijving |
Tijdsspanne |
|---|---|---|
|
Overeenkomst met Expertconsensus (Cohen's Kappa)
Tijdsspanne: Aan het einde van de studie, ongeveer 12 maanden
|
Cohen's kappa-coëfficiënt die de overeenkomst meet tussen de BI-RADS-classificatie van elk AI-model en de expertconsensusannotatie, gerapporteerd met 95% betrouwbaarheidsintervallen.
|
Aan het einde van de studie, ongeveer 12 maanden
|
|
Uit-distributie Afwijzingspercentage
Tijdsspanne: Aan het einde van de studie, ongeveer 12 maanden
|
Proportie niet-diagnostische afbeeldingen (verslechterde kwaliteit, niet-borst-echografie, andere beeldvormingstechnieken) correct geïdentificeerd en geweigerd door AI-modellen, waarbij domeinveiligheid wordt geëvalueerd.
|
Aan het einde van de studie, ongeveer 12 maanden
|
|
Sensitiviteit, Specificiteit, PPV, NPV en F1-Score
Tijdsspanne: Aan het einde van het onderzoek, ongeveer 12 maanden
|
Standaard diagnostische prestatiemetingen voor goedaardig-kwaadaardige classificatie, gerapporteerd voor elk AI-model afzonderlijk.
|
Aan het einde van het onderzoek, ongeveer 12 maanden
|
Medewerkers en onderzoekers
Medewerkers
Onderzoekers
- Hoofdonderzoeker: Qingli Zhu, MD, Peking Union Medical College Hospital
Publicaties en nuttige links
Algemene publicaties
- Sung H, Ferlay J, Siegel RL, Laversanne M, Soerjomataram I, Jemal A, Bray F. Global Cancer Statistics 2020: GLOBOCAN Estimates of Incidence and Mortality Worldwide for 36 Cancers in 185 Countries. CA Cancer J Clin. 2021 May;71(3):209-249. doi: 10.3322/caac.21660. Epub 2021 Feb 4.
- Bi WL, Hosny A, Schabath MB, Giger ML, Birkbak NJ, Mehrtash A, Allison T, Arnaout O, Abbosh C, Dunn IF, Mak RH, Tamimi RM, Tempany CM, Swanton C, Hoffmann U, Schwartz LH, Gillies RJ, Huang RY, Aerts HJWL. Artificial intelligence in cancer imaging: Clinical challenges and applications. CA Cancer J Clin. 2019 Mar;69(2):127-157. doi: 10.3322/caac.21552. Epub 2019 Feb 5.
- Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, Ghassemi M, Liu X, Reitsma JB, van Smeden M, Boulesteix AL, Camaradou JC, Celi LA, Denaxas S, Denniston AK, Glocker B, Golub RM, Harvey H, Heinze G, Hoffman MM, Kengne AP, Lam E, Lee N, Loder EW, Maier-Hein L, Mateen BA, McCradden MD, Oakden-Rayner L, Ordish J, Parnell R, Rose S, Singh K, Wynants L, Logullo P. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024 Apr 16;385:e078378. doi: 10.1136/bmj-2023-078378.
- Benary M, Wang XD, Schmidt M, Soll D, Hilfenhaus G, Nassir M, Sigler C, Knodler M, Keller U, Beule D, Keilholz U, Leser U, Rieke DT. Leveraging Large Language Models for Decision Support in Personalized Oncology. JAMA Netw Open. 2023 Nov 1;6(11):e2343689. doi: 10.1001/jamanetworkopen.2023.43689.
- Bhayana R, Krishna S, Bleakney RR. Performance of ChatGPT on a Radiology Board-style Examination: Insights into Current Strengths and Limitations. Radiology. 2023 Jun;307(5):e230582. doi: 10.1148/radiol.230582. Epub 2023 May 16.
- Clusmann J, Kolbinger FR, Muti HS, Carrero ZI, Eckardt JN, Laleh NG, Loffler CML, Schwarzkopf SC, Unger M, Veldhuizen GP, Wagner SJ, Kather JN. The future landscape of large language models in medicine. Commun Med (Lond). 2023 Oct 10;3(1):141. doi: 10.1038/s43856-023-00370-1.
- Seyyed-Kalantari L, Zhang H, McDermott MBA, Chen IY, Ghassemi M. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021 Dec;27(12):2176-2182. doi: 10.1038/s41591-021-01595-0. Epub 2021 Dec 10.
- Moor M, Banerjee O, Abad ZSH, Krumholz HM, Leskovec J, Topol EJ, Rajpurkar P. Foundation models for generalist medical artificial intelligence. Nature. 2023 Apr;616(7956):259-265. doi: 10.1038/s41586-023-05881-4. Epub 2023 Apr 12.
- Miaojiao S, Xia L, Xian Tao Z, Zhi Liang H, Sheng C, Songsong W. Using a Large Language Model for Breast Imaging Reporting and Data System Classification and Malignancy Prediction to Enhance Breast Ultrasound Diagnosis: Retrospective Study. JMIR Med Inform. 2025 Jun 11;13:e70924. doi: 10.2196/70924.
- Jiao J, Zhou J, Li X, Xia M, Huang Y, Huang L, Wang N, Zhang X, Zhou S, Wang Y, Guo Y. USFM: A universal ultrasound foundation model generalized to tasks and organs towards label efficient image analysis. Med Image Anal. 2024 Aug;96:103202. doi: 10.1016/j.media.2024.103202. Epub 2024 May 15.
- Xiang H, Wang X, Xu M, Zhang Y, Zeng S, Li C, Liu L, Deng T, Tang G, Yan C, Ou J, Lin Q, He J, Sun P, Li A, Chen H, Heng PA, Lin X. Deep Learning-assisted Diagnosis of Breast Lesions on US Images: A Multivendor, Multicenter Study. Radiol Artif Intell. 2023 Jul 12;5(5):e220185. doi: 10.1148/ryai.220185. eCollection 2023 Sep.
- Kottlors J, Iuga AI, Bluethgen C, Bressem K, Kather JN, Moy L, Wald C, Wang W, Liu T, Ranschaert E, Dratsch T, Kleesiek J, Gertz RJ, Rajpurkar P, Bedayat A, Fink MA, Zeeck A, Chaudhari A, Alkasab T, Wu H, Nensa F, Wang B, Grosse Hokamp N, Laukamp KR, Persigehl T, Maintz D, Truhn D, Lennartz S. Guidelines for Reporting Studies on Large Language Models in Radiology: An International Delphi Expert Survey. Radiology. 2026 Feb;318(2):e250913. doi: 10.1148/radiol.250913.
Studie record data
Bestudeer belangrijke data
Studie start (Werkelijk)
Primaire voltooiing (Geschat)
Studie voltooiing (Geschat)
Studieregistratiedata
Eerst ingediend
Eerst ingediend dat voldeed aan de QC-criteria
Eerst geplaatst (Werkelijk)
Updates van studierecords
Laatste update geplaatst (Werkelijk)
Laatste update ingediend die voldeed aan QC-criteria
Laatst geverifieerd
Meer informatie
Termen gerelateerd aan deze studie
Trefwoorden
Aanvullende relevante MeSH-voorwaarden
Andere studie-ID-nummers
- K10349
- 2024-I2M-CT-B-035 (Ander subsidie-/financieringsnummer: CAMS Innovation Fund for Medical Sciences)
- I-26PJ0568 (Andere identificatie: Ethics Committee, Peking Union Medical College Hospital)
Plan Individuele Deelnemersgegevens (IPD)
Bent u van plan om gegevens van individuele deelnemers (IPD) te delen?
Beschrijving IPD-plan
IPD-tijdsbestek voor delen
IPD-toegangscriteria voor delen
IPD delen Ondersteunend informatietype
- LEERPROTOCOOL
- SAP
- ANALYTIC_CODE
Informatie over medicijnen en apparaten, studiedocumenten
Bestudeert een door de Amerikaanse FDA gereguleerd geneesmiddel
Bestudeert een door de Amerikaanse FDA gereguleerd apparaatproduct
Deze informatie is zonder wijzigingen rechtstreeks van de website clinicaltrials.gov gehaald. Als u verzoeken heeft om uw onderzoeksgegevens te wijzigen, te verwijderen of bij te werken, neem dan contact op met register@clinicaltrials.gov. Zodra er een wijziging wordt doorgevoerd op clinicaltrials.gov, wordt deze ook automatisch bijgewerkt op onze website .