- ICH GCP
- Registre américain des essais cliniques
- Essai clinique NCT07500428
Construction d'un référentiel pour l'interprétation de l'échographie mammaire par IA et évaluation des performances des modèles d'IA multimodaux (BUST-AI Bench)
Construction d'un système d'évaluation de référence standardisé pour l'interprétation intelligente des images d'échographie mammaire et évaluation systématique des performances des modèles d'intelligence artificielle multimodale basée sur les critères ACR BI-RADS v2025
Cette étude observationnelle rétrospective monocentrique vise à construire un système d'évaluation de référence standardisé pour l'interprétation intelligente des images d'échographie mammaire et à évaluer systématiquement les performances diagnostiques des principaux modèles d'intelligence artificielle (IA) multimodaux actuels.
Des images d'échographie mammaire en mode B anonymisées avec des diagnostics pathologiques confirmés seront collectées rétrospectivement à partir des archives institutionnelles (2018-2025) et complétées par des images provenant de jeux de données en libre accès publiés. Des radiologues experts de différents niveaux d'expérience annoteront indépendamment toutes les images selon les critères du système de rapportage et de données d'imagerie mammaire (BI-RADS) v2025 de l'American College of Radiology (ACR), y compris la composition du tissu glandulaire, la caractérisation des lésions (masse vs. lésion non-masse), les descripteurs morphologiques et la classification BI-RADS finale.
Des modèles de base d'apprentissage profond (ResNet-50 basé sur CNN et USFM basé sur Transformer) seront entraînés pour établir des références de performance et pour stratifier les cas par difficulté diagnostique via un consensus inter-architecture. Plusieurs grands modèles de langage multimodaux (MLLM), incluant à la fois des modèles généralistes et spécialisés dans le domaine médical, seront ensuite évalués via des appels API standardisés en utilisant des prompts guidés par BI-RADS en chaîne de réflexion à température 0 pour la reproductibilité.
Les critères d'évaluation principaux incluent la précision de classification BI-RADS et l'AUC diagnostique pour la différenciation bénigne-maligne. La robustesse et la sécurité des modèles seront évaluées via des tests de rejet hors distribution, des expériences de stabilité en température et des études d'ablation des modes de réflexion. Cette étude respecte les directives de rapportage FLAIR et TRIPOD-LLM.
Aperçu de l'étude
Statut
Les conditions
Intervention / Traitement
Description détaillée
Contexte : Le cancer du sein est la tumeur maligne la plus répandue chez les femmes dans le monde. L'échographie est une modalité de dépistage de première intention, en particulier dans les populations asiatiques ayant un tissu mammaire dense où la sensibilité de la mammographie est limitée. Cependant, l'interprétation de l'échographie est fortement dépendante de l'opérateur, avec une variabilité inter-observateur substantielle dans la classification BI-RADS, en particulier pour les lésions de catégorie 4A-4B. Les modèles de langage multimodaux de grande taille (MLLM) sont apparus comme un outil prometteur pour l'analyse d'images médicales en raison de leur capacité de diagnostic en zero-shot, de leur raisonnement en chaîne de pensée interprétable et de leur génération de rapports structurés. Néanmoins, il n'existe actuellement aucun benchmark standardisé pour évaluer la performance de l'IA dans l'interprétation de l'échographie mammaire.
Conception de l'étude : Environ 1 380 images d'échographie mammaire seront sélectionnées (1 200 pour l'ensemble d'évaluation + 150 pour l'ensemble de test de sécurité hors distribution + 30 pour l'ensemble de développement d'invites), couvrant trois catégories diagnostiques : sein normal, lésions bénignes (BI-RADS 2-4B) et lésions malignes (BI-RADS 3-5). Deux radiologues juniors (<5 ans d'expérience) et deux radiologues seniors (>15 ans) annoteront indépendamment les images selon l'ACR BI-RADS v2025, avec arbitrage par un cinquième expert pour les cas discordants.
La difficulté diagnostique sera stratifiée en trois niveaux en utilisant un consensus d'apprentissage profond inter-architecture : Niveau 1 (simple, les deux modèles corrects), Niveau 2 (équivoque, un correct/un incorrect), Niveau 3 (difficile, les deux incorrects, avec validation par un expert senior). Les MLLM seront évalués selon plusieurs dimensions : précision de classification, sensibilité, spécificité, score F1, AUC, accord kappa de Cohen avec le consensus d'experts, erreur d'étalonnage attendue (ECE), précision de la description des caractéristiques morphologiques et qualité du raisonnement en chaîne de pensée.
Évaluation de la sécurité : (1) Test de rejet hors distribution utilisant 150 images non diagnostiques (images dégradées, échographies non mammaires, autres modalités d'imagerie) ; (2) Pré-expérimentation de stabilité de température à travers les paramètres de réglage ; (3) Ablation du mode de pensée comparant les modes de raisonnement standard vs. en chaîne de pensée. Toutes les expériences utilisent des instantanés de modèles fixes, une surveillance de l'empreinte du système et une journalisation complète pour la reproductibilité.
Type d'étude
Inscription (Estimé)
Contacts et emplacements
Coordonnées de l'étude
- Nom: Qingli Zhu, MD
- Numéro de téléphone: +86 13621376699
- E-mail: zqlpumch@126.com
Sauvegarde des contacts de l'étude
- Nom: Yinglan Wu, MD
- Numéro de téléphone: +86 15626121076
- E-mail: wuylan7@gmail.com
Lieux d'étude
-
-
-
Beijing, Chine, 100730
- Recrutement
- Peking Union Medical College Hospital
-
Contact:
- Qingli Zhu, MD
- Numéro de téléphone: +86 13621376699
- E-mail: zqlpumch@126.com
-
-
Critères de participation
Critère d'éligibilité
Âges éligibles pour étudier
- Adulte
- Adulte plus âgé
Accepte les volontaires sains
Méthode d'échantillonnage
Population étudiée
La description
Critères d'inclusion :
- Images échographiques mammaires en mode B en niveaux de gris provenant de la base de données PACS institutionnelle ou de jeux de données échographiques mammaires en accès libre publiés, avec une approbation éthique institutionnelle d'origine documentée
- Qualité d'image adéquate pour le diagnostic clinique avec visualisation claire de la région d'intérêt
- Diagnostic pathologique confirmé (pour les groupes de lésions bénignes et malignes), ou statut mammaire normal confirmé par un radiologue senior avec >15 ans d'expérience en échographie mammaire (pour le groupe normal)
- Désidentification complète avec suppression de toutes les informations personnellement identifiables
Critères d'exclusion :
- Qualité d'image sévèrement dégradée empêchant une évaluation BI-RADS significative
- Images en double du même patient (seule l'image la plus représentative conservée par lésion)
- Images avec des informations personnellement identifiables résiduelles après traitement de désidentification
- Cas avec des résultats pathologiques ambigus, contestés ou indisponibles
- Images échographiques non en mode B, y compris élastographie, échographie de contraste et imagerie Doppler
Plan d'étude
Comment l'étude est-elle conçue ?
Détails de conception
Cohortes et interventions
Groupe / Cohorte |
Intervention / Traitement |
|---|---|
|
Sein Normal
Images échographiques du sein montrant un tissu glandulaire normal à travers différents types de composition tissulaire, sans lésion focale identifiée.
Confirmé par une relecture par un radiologue senior.
|
Évaluation rétrospective d'images échographiques mammaires anonymisées par plusieurs systèmes d'IA, incluant des modèles d'apprentissage profond de base (ResNet-50, USFM) et des modèles de langage multimodal de grande taille, utilisant des invites de raisonnement en chaîne guidées par BI-RADS standardisées via API.
Aucun contact avec les patients ou prise de décision clinique n'est impliqué.
|
|
Lésion bénigne
Images d'échographie mammaire contenant des lésions bénignes confirmées par examen anatomopathologique (BI-RADS 2-4B), incluant fibroadénome, kyste, lipome, adénose sclérosante, papillome intra-canalaire et certaines lésions non massiques (LNM) sélectionnées.
|
Évaluation rétrospective d'images échographiques mammaires anonymisées par plusieurs systèmes d'IA, incluant des modèles d'apprentissage profond de base (ResNet-50, USFM) et des modèles de langage multimodal de grande taille, utilisant des invites de raisonnement en chaîne guidées par BI-RADS standardisées via API.
Aucun contact avec les patients ou prise de décision clinique n'est impliqué.
|
|
Lésion Maligne
Images d'échographie mammaire contenant des lésions malignes confirmées par anatomopathologie (BI-RADS 3-5), y compris le carcinome canalaire infiltrant, le carcinome lobulaire infiltrant, le carcinome mucineux et des lésions non tumorales sélectionnées (NML).
|
Évaluation rétrospective d'images échographiques mammaires anonymisées par plusieurs systèmes d'IA, incluant des modèles d'apprentissage profond de base (ResNet-50, USFM) et des modèles de langage multimodal de grande taille, utilisant des invites de raisonnement en chaîne guidées par BI-RADS standardisées via API.
Aucun contact avec les patients ou prise de décision clinique n'est impliqué.
|
Que mesure l'étude ?
Principaux critères de jugement
Mesure des résultats |
Description de la mesure |
Délai |
|---|---|---|
|
Précision diagnostique pour le diagnostic pathologique
Délai: À la fin de l'étude, environ 12 mois
|
Sensibilité, spécificité, valeur prédictive positive (VPP), valeur prédictive négative (VPN) et score F1 des modèles d'IA pour la classification bénin-malin, avec le diagnostic histopathologique comme référence standard.
|
À la fin de l'étude, environ 12 mois
|
|
Précision de la Classification BI-RADS
Délai: À la fin de l'étude, environ 12 mois
|
Précision globale des modèles d'IA dans l'attribution des catégories BI-RADS (2, 3, 4A, 4B, 4C, 5) aux images d'échographie mammaire, comparée à l'annotation de consensus d'experts comme référence standard.
|
À la fin de l'étude, environ 12 mois
|
Mesures de résultats secondaires
Mesure des résultats |
Description de la mesure |
Délai |
|---|---|---|
|
Concordance avec le Consensus d'Experts (Kappa de Cohen)
Délai: À la fin de l'étude, environ 12 mois
|
Coefficient kappa de Cohen mesurant l'accord entre la classification BI-RADS de chaque modèle d'IA et l'annotation de consensus d'experts, rapporté avec des intervalles de confiance à 95 %.
|
À la fin de l'étude, environ 12 mois
|
|
Taux de rejet hors distribution
Délai: À l'achèvement de l'étude, environ 12 mois
|
Proportion d'images non diagnostiques (qualité dégradée, échographie non mammaire, autres modalités d'imagerie) correctement identifiées et refusées par les modèles d'IA, évaluant la sécurité du domaine.
|
À l'achèvement de l'étude, environ 12 mois
|
|
Sensibilité, Spécificité, VPP, VPN et Score F1
Délai: À l'achèvement de l'étude, environ 12 mois
|
Indicateurs de performance diagnostique standard pour la classification bénigne-maligne, rapportés pour chaque modèle d'IA individuellement.
|
À l'achèvement de l'étude, environ 12 mois
|
Collaborateurs et enquêteurs
Parrainer
Collaborateurs
Les enquêteurs
- Chercheur principal: Qingli Zhu, MD, Peking Union Medical College Hospital
Publications et liens utiles
Publications générales
- Sung H, Ferlay J, Siegel RL, Laversanne M, Soerjomataram I, Jemal A, Bray F. Global Cancer Statistics 2020: GLOBOCAN Estimates of Incidence and Mortality Worldwide for 36 Cancers in 185 Countries. CA Cancer J Clin. 2021 May;71(3):209-249. doi: 10.3322/caac.21660. Epub 2021 Feb 4.
- Bi WL, Hosny A, Schabath MB, Giger ML, Birkbak NJ, Mehrtash A, Allison T, Arnaout O, Abbosh C, Dunn IF, Mak RH, Tamimi RM, Tempany CM, Swanton C, Hoffmann U, Schwartz LH, Gillies RJ, Huang RY, Aerts HJWL. Artificial intelligence in cancer imaging: Clinical challenges and applications. CA Cancer J Clin. 2019 Mar;69(2):127-157. doi: 10.3322/caac.21552. Epub 2019 Feb 5.
- Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, Ghassemi M, Liu X, Reitsma JB, van Smeden M, Boulesteix AL, Camaradou JC, Celi LA, Denaxas S, Denniston AK, Glocker B, Golub RM, Harvey H, Heinze G, Hoffman MM, Kengne AP, Lam E, Lee N, Loder EW, Maier-Hein L, Mateen BA, McCradden MD, Oakden-Rayner L, Ordish J, Parnell R, Rose S, Singh K, Wynants L, Logullo P. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024 Apr 16;385:e078378. doi: 10.1136/bmj-2023-078378.
- Benary M, Wang XD, Schmidt M, Soll D, Hilfenhaus G, Nassir M, Sigler C, Knodler M, Keller U, Beule D, Keilholz U, Leser U, Rieke DT. Leveraging Large Language Models for Decision Support in Personalized Oncology. JAMA Netw Open. 2023 Nov 1;6(11):e2343689. doi: 10.1001/jamanetworkopen.2023.43689.
- Bhayana R, Krishna S, Bleakney RR. Performance of ChatGPT on a Radiology Board-style Examination: Insights into Current Strengths and Limitations. Radiology. 2023 Jun;307(5):e230582. doi: 10.1148/radiol.230582. Epub 2023 May 16.
- Clusmann J, Kolbinger FR, Muti HS, Carrero ZI, Eckardt JN, Laleh NG, Loffler CML, Schwarzkopf SC, Unger M, Veldhuizen GP, Wagner SJ, Kather JN. The future landscape of large language models in medicine. Commun Med (Lond). 2023 Oct 10;3(1):141. doi: 10.1038/s43856-023-00370-1.
- Seyyed-Kalantari L, Zhang H, McDermott MBA, Chen IY, Ghassemi M. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021 Dec;27(12):2176-2182. doi: 10.1038/s41591-021-01595-0. Epub 2021 Dec 10.
- Moor M, Banerjee O, Abad ZSH, Krumholz HM, Leskovec J, Topol EJ, Rajpurkar P. Foundation models for generalist medical artificial intelligence. Nature. 2023 Apr;616(7956):259-265. doi: 10.1038/s41586-023-05881-4. Epub 2023 Apr 12.
- Miaojiao S, Xia L, Xian Tao Z, Zhi Liang H, Sheng C, Songsong W. Using a Large Language Model for Breast Imaging Reporting and Data System Classification and Malignancy Prediction to Enhance Breast Ultrasound Diagnosis: Retrospective Study. JMIR Med Inform. 2025 Jun 11;13:e70924. doi: 10.2196/70924.
- Jiao J, Zhou J, Li X, Xia M, Huang Y, Huang L, Wang N, Zhang X, Zhou S, Wang Y, Guo Y. USFM: A universal ultrasound foundation model generalized to tasks and organs towards label efficient image analysis. Med Image Anal. 2024 Aug;96:103202. doi: 10.1016/j.media.2024.103202. Epub 2024 May 15.
- Xiang H, Wang X, Xu M, Zhang Y, Zeng S, Li C, Liu L, Deng T, Tang G, Yan C, Ou J, Lin Q, He J, Sun P, Li A, Chen H, Heng PA, Lin X. Deep Learning-assisted Diagnosis of Breast Lesions on US Images: A Multivendor, Multicenter Study. Radiol Artif Intell. 2023 Jul 12;5(5):e220185. doi: 10.1148/ryai.220185. eCollection 2023 Sep.
- Kottlors J, Iuga AI, Bluethgen C, Bressem K, Kather JN, Moy L, Wald C, Wang W, Liu T, Ranschaert E, Dratsch T, Kleesiek J, Gertz RJ, Rajpurkar P, Bedayat A, Fink MA, Zeeck A, Chaudhari A, Alkasab T, Wu H, Nensa F, Wang B, Grosse Hokamp N, Laukamp KR, Persigehl T, Maintz D, Truhn D, Lennartz S. Guidelines for Reporting Studies on Large Language Models in Radiology: An International Delphi Expert Survey. Radiology. 2026 Feb;318(2):e250913. doi: 10.1148/radiol.250913.
Dates d'enregistrement des études
Dates principales de l'étude
Début de l'étude (Réel)
Achèvement primaire (Estimé)
Achèvement de l'étude (Estimé)
Dates d'inscription aux études
Première soumission
Première soumission répondant aux critères de contrôle qualité
Première publication (Réel)
Mises à jour des dossiers d'étude
Dernière mise à jour publiée (Réel)
Dernière mise à jour soumise répondant aux critères de contrôle qualité
Dernière vérification
Plus d'information
Termes liés à cette étude
Mots clés
Termes MeSH pertinents supplémentaires
Autres numéros d'identification d'étude
- K10349
- 2024-I2M-CT-B-035 (Autre subvention/numéro de financement: CAMS Innovation Fund for Medical Sciences)
- I-26PJ0568 (Autre identifiant: Ethics Committee, Peking Union Medical College Hospital)
Plan pour les données individuelles des participants (IPD)
Prévoyez-vous de partager les données individuelles des participants (DPI) ?
Description du régime IPD
Délai de partage IPD
Critères d'accès au partage IPD
Type d'informations de prise en charge du partage d'IPD
- PROTOCOLE D'ÉTUDE
- SÈVE
- ANALYTIC_CODE
Informations sur les médicaments et les dispositifs, documents d'étude
Étudie un produit pharmaceutique réglementé par la FDA américaine
Étudie un produit d'appareil réglementé par la FDA américaine
Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .