Deze pagina is automatisch vertaald en de nauwkeurigheid van de vertaling kan niet worden gegarandeerd. Raadpleeg de Engelse versie voor een brontekst.

Constructie van een Benchmark voor Kunstmatige Intelligentie-interpretatie van Borst-echografie en Prestatie-evaluatie van Multimodale AI-modellen (BUST-AI Bench)

24 maart 2026 bijgewerkt door: Qingli Zhu, Peking Union Medical College Hospital

Constructie van een Gestandaardiseerd Benchmark Evaluatiesysteem voor Intelligente Interpretatie van Borst-echografiebeelden en Systematische Prestatiebeoordeling van Multimodale Kunstmatige Intelligentiemodellen Gebaseerd op ACR BI-RADS v2025 Criteria

Deze single-center, retrospectieve, observationele studie heeft als doel een gestandaardiseerd benchmark-evaluatiesysteem op te zetten voor intelligente interpretatie van borstechografiebeelden en om de diagnostische prestaties van huidige mainstream multimodale kunstmatige intelligentie (AI) modellen systematisch te beoordelen.

Geanonimiseerde B-mode borstechografiebeelden met bevestigde pathologische diagnoses zullen retrospectief worden verzameld uit het institutionele archief (2018-2025) en aangevuld met beelden uit gepubliceerde open-access datasets. Expert-radiologen met verschillende ervaringsniveaus zullen alle beelden onafhankelijk annoteren volgens de American College of Radiology (ACR) Breast Imaging Reporting and Data System (BI-RADS) v2025 criteria, inclusief klierweefselsamenstelling, laesiekarakterisering (massa versus niet-massa laesie), morfologische beschrijvers en de definitieve BI-RADS-classificatie.

Baseline deep learning modellen (CNN-gebaseerde ResNet-50 en Transformer-gebaseerde USFM) zullen worden getraind om prestatiebaselines vast te stellen en gevallen te stratificeren op diagnostische moeilijkheidsgraad door cross-architectuur consensus. Verschillende multimodale large language modellen (MLLMs), inclusief zowel algemene als medische domeinmodellen, zullen vervolgens worden geëvalueerd via gestandaardiseerde API-aanroepen met BI-RADS-gestuurde chain-of-thought prompts bij temperatuur 0 voor reproduceerbaarheid.

Primaire eindpunten omvatten BI-RADS-classificatienauwkeurigheid en diagnostische AUC voor goedaardig-kwaadaardig onderscheid. Modelrobuustheid en veiligheid zullen worden beoordeeld door out-of-distribution rejectietesten, temperatuur-stabiliteitsexperimenten en thinking-mode ablatiestudies. Deze studie houdt zich aan de FLAIR en TRIPOD-LLM rapportage richtlijnen.

Studie Overzicht

Gedetailleerde beschrijving

Achtergrond: Borstkanker is de meest voorkomende maligniteit bij vrouwen wereldwijd. Echografie is een eerstelijns screeningsmodaliteit, vooral bij Aziatische populaties met dicht borstweefsel waar de mammografische gevoeligheid beperkt is. Echter, de interpretatie van echografie is sterk operatorafhankelijk, met aanzienlijke inter-observer variabiliteit in BI-RADS classificatie, met name voor categorie 4A-4B laesies. Multimodale grote taalmodellen (MLLM's) zijn naar voren gekomen als een veelbelovend hulpmiddel voor medische beeldanalyse vanwege hun zero-shot diagnostische capaciteit, interpreteerbare keten-van-gedachte redenering, en gestructureerde rapportgeneratie. Desalniettemin is er momenteel geen gestandaardiseerde benchmark voor het evalueren van AI-prestaties in borst-echografie interpretatie.

Studieopzet: Ongeveer 1.380 borst-echografiebeelden zullen worden samengesteld (1.200 evaluatieset + 150 out-of-distribution veiligheidstestset + 30 prompt-ontwikkelingsset), omvattende drie diagnostische categorieën: normale borst, goedaardige laesies (BI-RADS 2-4B), en kwaadaardige laesies (BI-RADS 3-5). Twee junior radiologen (<5 jaar ervaring) en twee senior radiologen (>15 jaar) zullen onafhankelijk beelden annoteren volgens ACR BI-RADS v2025 met arbitrage door een vijfde expert voor niet-overeenstemmende gevallen.

Diagnostische moeilijkheid zal worden gestratificeerd in drie lagen met behulp van cross-architectuur deep learning consensus: Laag 1 (eenvoudig, beide modellen correct), Laag 2 (dubbelzinnig, één correct/één incorrect), en Laag 3 (moeilijk, beide incorrect, met senior expert validatie). MLLM's zullen worden geëvalueerd over meerdere dimensies: classificatie nauwkeurigheid, sensitiviteit, specificiteit, F1-score, AUC, Cohen's kappa overeenstemming met expert consensus, verwachte kalibratiefout (ECE), morfologische kenmerkbeschrijving nauwkeurigheid, en keten-van-gedachte redeneerkwaliteit.

Veiligheidsbeoordeling: (1) Out-of-distribution afwijzingstest met 150 niet-diagnostische beelden (gedegradeerde beelden, niet-borst echografie, andere beeldvormingsmodaliteiten); (2) Temperatuur-stabiliteit pre-experiment over parameterinstellingen; (3) Denkmodus-ablatie vergelijkend standaard vs. keten-van-gedachte redeneermodi. Alle experimenten gebruiken vaste model snapshots, systeem vingerafdruk monitoring, en volledige logging voor reproduceerbaarheid.

Studietype

Observationeel

Inschrijving (Geschat)

1380

Contacten en locaties

In dit gedeelte vindt u de contactgegevens van degenen die het onderzoek uitvoeren en informatie over waar dit onderzoek wordt uitgevoerd.

Studiecontact

Studie Contact Back-up

Studie Locaties

      • Beijing, China, 100730
        • Werving
        • Peking Union Medical College Hospital
        • Contact:

Deelname Criteria

Onderzoekers zoeken naar mensen die aan een bepaalde beschrijving voldoen, de zogenaamde geschiktheidscriteria. Enkele voorbeelden van deze criteria zijn iemands algemene gezondheidstoestand of eerdere behandelingen.

Geschiktheidscriteria

Leeftijden die in aanmerking komen voor studie

  • Volwassen
  • Oudere volwassene

Accepteert gezonde vrijwilligers

Ja

Bemonsteringsmethode

Niet-waarschijnlijkheidssteekproef

Studie Bevolking

Gedeïdentificeerde borst-echografiebeelden van volwassen patiënten die tussen 2018 en 2025 een borst-echografieonderzoek ondergingen in het Peking Union Medical College Hospital met daaropvolgende pathologische bevestiging, aangevuld met beelden uit gepubliceerde, ethisch goedgekeurde, open-access borst-echografiedatasets (bijv. BUSI, BrEaST).

Beschrijving

Inclusiecriteria:

  • B-mode borstechografie grijswaardenbeelden uit de institutionele PACS-database of uit gepubliceerde open-access borstechografie datasets met gedocumenteerde originele institutionele ethische goedkeuring
  • Beeldkwaliteit voldoende voor klinische diagnose met duidelijke visualisatie van het gebied van belang
  • Pathologische diagnose bevestigd (voor goedaardige en kwaadaardige letselgroepen), of normale borststatus bevestigd door een senior radioloog met >15 jaar borstechografie ervaring (voor de normale groep)
  • Volledige de-identificatie met verwijdering van alle persoonlijk identificeerbare informatie

Exclusiecriteria:

  • Ernstig aangetaste beeldkwaliteit die betekenisvolle BI-RADS-beoordeling verhindert
  • Dubbele beelden van dezelfde patiënt (alleen het meest representatieve beeld per letsel behouden)
  • Beelden met resterende persoonlijk identificeerbare informatie na de-identificatieverwerking
  • Gevallen met dubbelzinnige, betwiste of niet beschikbare pathologische resultaten
  • Niet-B-mode echografiebeelden, inclusief elastografie, contrast-verbeterde echografie en Doppler-beeldvorming

Studie plan

Dit gedeelte bevat details van het studieplan, inclusief hoe de studie is opgezet en wat de studie meet.

Hoe is de studie opgezet?

Ontwerpdetails

Cohorten en interventies

Groep / Cohort
Interventie / Behandeling
Normale Borst
Borstecho-afbeeldingen die normaal klierweefsel tonen bij verschillende weefselsamenstellingstypen, zonder focale laesies geïdentificeerd. Bevestigd door beoordeling van senior radioloog.
Retrospectieve evaluatie van geanonimiseerde borst-echografiebeelden door meerdere AI-systemen, waaronder baseline deep learning-modellen (ResNet-50, USFM) en multimodale grote taalmodellen, met behulp van gestandaardiseerde BI-RADS-gestuurde chain-of-thought-prompts via API. Er is geen patiëntcontact of klinische besluitvorming betrokken.
Goedaardige Laesie
Borst-echografiebeelden met pathologisch bevestigde goedaardige laesies (BI-RADS 2-4B), waaronder fibroadenoom, cyste, lipoom, scleroserende adenose, intraductaal papilloom en geselecteerde niet-massa-laesies (NML).
Retrospectieve evaluatie van geanonimiseerde borst-echografiebeelden door meerdere AI-systemen, waaronder baseline deep learning-modellen (ResNet-50, USFM) en multimodale grote taalmodellen, met behulp van gestandaardiseerde BI-RADS-gestuurde chain-of-thought-prompts via API. Er is geen patiëntcontact of klinische besluitvorming betrokken.
Kwaadaardige Laesie
Borstecho-afbeeldingen met pathologisch bevestigde maligne laesies (BI-RADS 3-5), waaronder invasief ductaal carcinoom, invasief lobulair carcinoom, mucineus carcinoom en geselecteerde non-mass laesies (NML).
Retrospectieve evaluatie van geanonimiseerde borst-echografiebeelden door meerdere AI-systemen, waaronder baseline deep learning-modellen (ResNet-50, USFM) en multimodale grote taalmodellen, met behulp van gestandaardiseerde BI-RADS-gestuurde chain-of-thought-prompts via API. Er is geen patiëntcontact of klinische besluitvorming betrokken.

Wat meet het onderzoek?

Primaire uitkomstmaten

Uitkomstmaat
Maatregel Beschrijving
Tijdsspanne
Diagnostische nauwkeurigheid voor pathologische diagnose
Tijdsspanne: Na afloop van de studie, ongeveer 12 maanden
Gevoeligheid, specificiteit, positief voorspellende waarde (PPV), negatief voorspellende waarde (NPV) en F1-score van AI-modellen voor goedaardig-kwaadaardige classificatie, met histopathologische diagnose als gouden standaard.
Na afloop van de studie, ongeveer 12 maanden
BI-RADS Classificatienauwkeurigheid
Tijdsspanne: Aan het einde van de studie, ongeveer 12 maanden
Algehele nauwkeurigheid van AI-modellen bij het toekennen van BI-RADS-categorieën (2, 3, 4A, 4B, 4C, 5) aan borst-echografiebeelden, vergeleken met expertconsensusannotatie als de referentiestandaard.
Aan het einde van de studie, ongeveer 12 maanden

Secundaire uitkomstmaten

Uitkomstmaat
Maatregel Beschrijving
Tijdsspanne
Overeenkomst met Expertconsensus (Cohen's Kappa)
Tijdsspanne: Aan het einde van de studie, ongeveer 12 maanden
Cohen's kappa-coëfficiënt die de overeenkomst meet tussen de BI-RADS-classificatie van elk AI-model en de expertconsensusannotatie, gerapporteerd met 95% betrouwbaarheidsintervallen.
Aan het einde van de studie, ongeveer 12 maanden
Uit-distributie Afwijzingspercentage
Tijdsspanne: Aan het einde van de studie, ongeveer 12 maanden
Proportie niet-diagnostische afbeeldingen (verslechterde kwaliteit, niet-borst-echografie, andere beeldvormingstechnieken) correct geïdentificeerd en geweigerd door AI-modellen, waarbij domeinveiligheid wordt geëvalueerd.
Aan het einde van de studie, ongeveer 12 maanden
Sensitiviteit, Specificiteit, PPV, NPV en F1-Score
Tijdsspanne: Aan het einde van het onderzoek, ongeveer 12 maanden
Standaard diagnostische prestatiemetingen voor goedaardig-kwaadaardige classificatie, gerapporteerd voor elk AI-model afzonderlijk.
Aan het einde van het onderzoek, ongeveer 12 maanden

Medewerkers en onderzoekers

Hier vindt u mensen en organisaties die betrokken zijn bij dit onderzoek.

Onderzoekers

  • Hoofdonderzoeker: Qingli Zhu, MD, Peking Union Medical College Hospital

Publicaties en nuttige links

De persoon die verantwoordelijk is voor het invoeren van informatie over het onderzoek stelt deze publicaties vrijwillig ter beschikking. Dit kan gaan over alles wat met het onderzoek te maken heeft.

Algemene publicaties

Studie record data

Deze datums volgen de voortgang van het onderzoeksdossier en de samenvatting van de ingediende resultaten bij ClinicalTrials.gov. Studieverslagen en gerapporteerde resultaten worden beoordeeld door de National Library of Medicine (NLM) om er zeker van te zijn dat ze voldoen aan specifieke kwaliteitscontrolenormen voordat ze op de openbare website worden geplaatst.

Bestudeer belangrijke data

Studie start (Werkelijk)

12 maart 2026

Primaire voltooiing (Geschat)

1 december 2026

Studie voltooiing (Geschat)

1 maart 2027

Studieregistratiedata

Eerst ingediend

24 maart 2026

Eerst ingediend dat voldeed aan de QC-criteria

24 maart 2026

Eerst geplaatst (Werkelijk)

30 maart 2026

Updates van studierecords

Laatste update geplaatst (Werkelijk)

30 maart 2026

Laatste update ingediend die voldeed aan QC-criteria

24 maart 2026

Laatst geverifieerd

1 maart 2026

Meer informatie

Termen gerelateerd aan deze studie

Andere studie-ID-nummers

  • K10349
  • 2024-I2M-CT-B-035 (Ander subsidie-/financieringsnummer: CAMS Innovation Fund for Medical Sciences)
  • I-26PJ0568 (Andere identificatie: Ethics Committee, Peking Union Medical College Hospital)

Plan Individuele Deelnemersgegevens (IPD)

Bent u van plan om gegevens van individuele deelnemers (IPD) te delen?

JA

Beschrijving IPD-plan

De geanonimiseerde benchmark-evaluatiedataset, inclusief door experts geannoteerde borst-echografiebeelden met bijbehorende BI-RADS leesrapporten, is gepland voor openbare vrijgave om academische reproduceerbaarheid en collaboratief onderzoek te bevorderen.

IPD-tijdsbestek voor delen

Binnen 6 maanden na primaire publicatie, onbeperkt beschikbaar

IPD-toegangscriteria voor delen

Open toegang via een erkende datarepository (te bepalen)

IPD delen Ondersteunend informatietype

  • LEERPROTOCOOL
  • SAP
  • ANALYTIC_CODE

Informatie over medicijnen en apparaten, studiedocumenten

Bestudeert een door de Amerikaanse FDA gereguleerd geneesmiddel

Nee

Bestudeert een door de Amerikaanse FDA gereguleerd apparaatproduct

Nee

Deze informatie is zonder wijzigingen rechtstreeks van de website clinicaltrials.gov gehaald. Als u verzoeken heeft om uw onderzoeksgegevens te wijzigen, te verwijderen of bij te werken, neem dan contact op met register@clinicaltrials.gov. Zodra er een wijziging wordt doorgevoerd op clinicaltrials.gov, wordt deze ook automatisch bijgewerkt op onze website .

Abonneren