Cette page a été traduite automatiquement et l'exactitude de la traduction n'est pas garantie. Veuillez vous référer au version anglaise pour un texte source.

Construction d'un référentiel pour l'interprétation de l'échographie mammaire par IA et évaluation des performances des modèles d'IA multimodaux (BUST-AI Bench)

24 mars 2026 mis à jour par: Qingli Zhu, Peking Union Medical College Hospital

Construction d'un système d'évaluation de référence standardisé pour l'interprétation intelligente des images d'échographie mammaire et évaluation systématique des performances des modèles d'intelligence artificielle multimodale basée sur les critères ACR BI-RADS v2025

Cette étude observationnelle rétrospective monocentrique vise à construire un système d'évaluation de référence standardisé pour l'interprétation intelligente des images d'échographie mammaire et à évaluer systématiquement les performances diagnostiques des principaux modèles d'intelligence artificielle (IA) multimodaux actuels.

Des images d'échographie mammaire en mode B anonymisées avec des diagnostics pathologiques confirmés seront collectées rétrospectivement à partir des archives institutionnelles (2018-2025) et complétées par des images provenant de jeux de données en libre accès publiés. Des radiologues experts de différents niveaux d'expérience annoteront indépendamment toutes les images selon les critères du système de rapportage et de données d'imagerie mammaire (BI-RADS) v2025 de l'American College of Radiology (ACR), y compris la composition du tissu glandulaire, la caractérisation des lésions (masse vs. lésion non-masse), les descripteurs morphologiques et la classification BI-RADS finale.

Des modèles de base d'apprentissage profond (ResNet-50 basé sur CNN et USFM basé sur Transformer) seront entraînés pour établir des références de performance et pour stratifier les cas par difficulté diagnostique via un consensus inter-architecture. Plusieurs grands modèles de langage multimodaux (MLLM), incluant à la fois des modèles généralistes et spécialisés dans le domaine médical, seront ensuite évalués via des appels API standardisés en utilisant des prompts guidés par BI-RADS en chaîne de réflexion à température 0 pour la reproductibilité.

Les critères d'évaluation principaux incluent la précision de classification BI-RADS et l'AUC diagnostique pour la différenciation bénigne-maligne. La robustesse et la sécurité des modèles seront évaluées via des tests de rejet hors distribution, des expériences de stabilité en température et des études d'ablation des modes de réflexion. Cette étude respecte les directives de rapportage FLAIR et TRIPOD-LLM.

Aperçu de l'étude

Description détaillée

Contexte : Le cancer du sein est la tumeur maligne la plus répandue chez les femmes dans le monde. L'échographie est une modalité de dépistage de première intention, en particulier dans les populations asiatiques ayant un tissu mammaire dense où la sensibilité de la mammographie est limitée. Cependant, l'interprétation de l'échographie est fortement dépendante de l'opérateur, avec une variabilité inter-observateur substantielle dans la classification BI-RADS, en particulier pour les lésions de catégorie 4A-4B. Les modèles de langage multimodaux de grande taille (MLLM) sont apparus comme un outil prometteur pour l'analyse d'images médicales en raison de leur capacité de diagnostic en zero-shot, de leur raisonnement en chaîne de pensée interprétable et de leur génération de rapports structurés. Néanmoins, il n'existe actuellement aucun benchmark standardisé pour évaluer la performance de l'IA dans l'interprétation de l'échographie mammaire.

Conception de l'étude : Environ 1 380 images d'échographie mammaire seront sélectionnées (1 200 pour l'ensemble d'évaluation + 150 pour l'ensemble de test de sécurité hors distribution + 30 pour l'ensemble de développement d'invites), couvrant trois catégories diagnostiques : sein normal, lésions bénignes (BI-RADS 2-4B) et lésions malignes (BI-RADS 3-5). Deux radiologues juniors (<5 ans d'expérience) et deux radiologues seniors (>15 ans) annoteront indépendamment les images selon l'ACR BI-RADS v2025, avec arbitrage par un cinquième expert pour les cas discordants.

La difficulté diagnostique sera stratifiée en trois niveaux en utilisant un consensus d'apprentissage profond inter-architecture : Niveau 1 (simple, les deux modèles corrects), Niveau 2 (équivoque, un correct/un incorrect), Niveau 3 (difficile, les deux incorrects, avec validation par un expert senior). Les MLLM seront évalués selon plusieurs dimensions : précision de classification, sensibilité, spécificité, score F1, AUC, accord kappa de Cohen avec le consensus d'experts, erreur d'étalonnage attendue (ECE), précision de la description des caractéristiques morphologiques et qualité du raisonnement en chaîne de pensée.

Évaluation de la sécurité : (1) Test de rejet hors distribution utilisant 150 images non diagnostiques (images dégradées, échographies non mammaires, autres modalités d'imagerie) ; (2) Pré-expérimentation de stabilité de température à travers les paramètres de réglage ; (3) Ablation du mode de pensée comparant les modes de raisonnement standard vs. en chaîne de pensée. Toutes les expériences utilisent des instantanés de modèles fixes, une surveillance de l'empreinte du système et une journalisation complète pour la reproductibilité.

Type d'étude

Observationnel

Inscription (Estimé)

1380

Contacts et emplacements

Cette section fournit les coordonnées de ceux qui mènent l'étude et des informations sur le lieu où cette étude est menée.

Coordonnées de l'étude

  • Nom: Qingli Zhu, MD
  • Numéro de téléphone: +86 13621376699
  • E-mail: zqlpumch@126.com

Sauvegarde des contacts de l'étude

  • Nom: Yinglan Wu, MD
  • Numéro de téléphone: +86 15626121076
  • E-mail: wuylan7@gmail.com

Lieux d'étude

      • Beijing, Chine, 100730
        • Recrutement
        • Peking Union Medical College Hospital
        • Contact:
          • Qingli Zhu, MD
          • Numéro de téléphone: +86 13621376699
          • E-mail: zqlpumch@126.com

Critères de participation

Les chercheurs recherchent des personnes qui correspondent à une certaine description, appelée critères d'éligibilité. Certains exemples de ces critères sont l'état de santé général d'une personne ou des traitements antérieurs.

Critère d'éligibilité

Âges éligibles pour étudier

  • Adulte
  • Adulte plus âgé

Accepte les volontaires sains

Oui

Méthode d'échantillonnage

Échantillon non probabiliste

Population étudiée

Images d'échographie mammaire dé-identifiées provenant de patientes adultes ayant subi un examen d'échographie mammaire au Peking Union Medical College Hospital entre 2018 et 2025 avec confirmation pathologique ultérieure, complétées par des images provenant de jeux de données d'échographie mammaire publiés, approuvés par un comité d'éthique et en accès libre (par exemple, BUSI, BrEaST).

La description

Critères d'inclusion :

  • Images échographiques mammaires en mode B en niveaux de gris provenant de la base de données PACS institutionnelle ou de jeux de données échographiques mammaires en accès libre publiés, avec une approbation éthique institutionnelle d'origine documentée
  • Qualité d'image adéquate pour le diagnostic clinique avec visualisation claire de la région d'intérêt
  • Diagnostic pathologique confirmé (pour les groupes de lésions bénignes et malignes), ou statut mammaire normal confirmé par un radiologue senior avec >15 ans d'expérience en échographie mammaire (pour le groupe normal)
  • Désidentification complète avec suppression de toutes les informations personnellement identifiables

Critères d'exclusion :

  • Qualité d'image sévèrement dégradée empêchant une évaluation BI-RADS significative
  • Images en double du même patient (seule l'image la plus représentative conservée par lésion)
  • Images avec des informations personnellement identifiables résiduelles après traitement de désidentification
  • Cas avec des résultats pathologiques ambigus, contestés ou indisponibles
  • Images échographiques non en mode B, y compris élastographie, échographie de contraste et imagerie Doppler

Plan d'étude

Cette section fournit des détails sur le plan d'étude, y compris la façon dont l'étude est conçue et ce que l'étude mesure.

Comment l'étude est-elle conçue ?

Détails de conception

Cohortes et interventions

Groupe / Cohorte
Intervention / Traitement
Sein Normal
Images échographiques du sein montrant un tissu glandulaire normal à travers différents types de composition tissulaire, sans lésion focale identifiée. Confirmé par une relecture par un radiologue senior.
Évaluation rétrospective d'images échographiques mammaires anonymisées par plusieurs systèmes d'IA, incluant des modèles d'apprentissage profond de base (ResNet-50, USFM) et des modèles de langage multimodal de grande taille, utilisant des invites de raisonnement en chaîne guidées par BI-RADS standardisées via API. Aucun contact avec les patients ou prise de décision clinique n'est impliqué.
Lésion bénigne
Images d'échographie mammaire contenant des lésions bénignes confirmées par examen anatomopathologique (BI-RADS 2-4B), incluant fibroadénome, kyste, lipome, adénose sclérosante, papillome intra-canalaire et certaines lésions non massiques (LNM) sélectionnées.
Évaluation rétrospective d'images échographiques mammaires anonymisées par plusieurs systèmes d'IA, incluant des modèles d'apprentissage profond de base (ResNet-50, USFM) et des modèles de langage multimodal de grande taille, utilisant des invites de raisonnement en chaîne guidées par BI-RADS standardisées via API. Aucun contact avec les patients ou prise de décision clinique n'est impliqué.
Lésion Maligne
Images d'échographie mammaire contenant des lésions malignes confirmées par anatomopathologie (BI-RADS 3-5), y compris le carcinome canalaire infiltrant, le carcinome lobulaire infiltrant, le carcinome mucineux et des lésions non tumorales sélectionnées (NML).
Évaluation rétrospective d'images échographiques mammaires anonymisées par plusieurs systèmes d'IA, incluant des modèles d'apprentissage profond de base (ResNet-50, USFM) et des modèles de langage multimodal de grande taille, utilisant des invites de raisonnement en chaîne guidées par BI-RADS standardisées via API. Aucun contact avec les patients ou prise de décision clinique n'est impliqué.

Que mesure l'étude ?

Principaux critères de jugement

Mesure des résultats
Description de la mesure
Délai
Précision diagnostique pour le diagnostic pathologique
Délai: À la fin de l'étude, environ 12 mois
Sensibilité, spécificité, valeur prédictive positive (VPP), valeur prédictive négative (VPN) et score F1 des modèles d'IA pour la classification bénin-malin, avec le diagnostic histopathologique comme référence standard.
À la fin de l'étude, environ 12 mois
Précision de la Classification BI-RADS
Délai: À la fin de l'étude, environ 12 mois
Précision globale des modèles d'IA dans l'attribution des catégories BI-RADS (2, 3, 4A, 4B, 4C, 5) aux images d'échographie mammaire, comparée à l'annotation de consensus d'experts comme référence standard.
À la fin de l'étude, environ 12 mois

Mesures de résultats secondaires

Mesure des résultats
Description de la mesure
Délai
Concordance avec le Consensus d'Experts (Kappa de Cohen)
Délai: À la fin de l'étude, environ 12 mois
Coefficient kappa de Cohen mesurant l'accord entre la classification BI-RADS de chaque modèle d'IA et l'annotation de consensus d'experts, rapporté avec des intervalles de confiance à 95 %.
À la fin de l'étude, environ 12 mois
Taux de rejet hors distribution
Délai: À l'achèvement de l'étude, environ 12 mois
Proportion d'images non diagnostiques (qualité dégradée, échographie non mammaire, autres modalités d'imagerie) correctement identifiées et refusées par les modèles d'IA, évaluant la sécurité du domaine.
À l'achèvement de l'étude, environ 12 mois
Sensibilité, Spécificité, VPP, VPN et Score F1
Délai: À l'achèvement de l'étude, environ 12 mois
Indicateurs de performance diagnostique standard pour la classification bénigne-maligne, rapportés pour chaque modèle d'IA individuellement.
À l'achèvement de l'étude, environ 12 mois

Collaborateurs et enquêteurs

C'est ici que vous trouverez les personnes et les organisations impliquées dans cette étude.

Les enquêteurs

  • Chercheur principal: Qingli Zhu, MD, Peking Union Medical College Hospital

Publications et liens utiles

La personne responsable de la saisie des informations sur l'étude fournit volontairement ces publications. Il peut s'agir de tout ce qui concerne l'étude.

Publications générales

Dates d'enregistrement des études

Ces dates suivent la progression des dossiers d'étude et des soumissions de résultats sommaires à ClinicalTrials.gov. Les dossiers d'étude et les résultats rapportés sont examinés par la Bibliothèque nationale de médecine (NLM) pour s'assurer qu'ils répondent à des normes de contrôle de qualité spécifiques avant d'être publiés sur le site Web public.

Dates principales de l'étude

Début de l'étude (Réel)

12 mars 2026

Achèvement primaire (Estimé)

1 décembre 2026

Achèvement de l'étude (Estimé)

1 mars 2027

Dates d'inscription aux études

Première soumission

24 mars 2026

Première soumission répondant aux critères de contrôle qualité

24 mars 2026

Première publication (Réel)

30 mars 2026

Mises à jour des dossiers d'étude

Dernière mise à jour publiée (Réel)

30 mars 2026

Dernière mise à jour soumise répondant aux critères de contrôle qualité

24 mars 2026

Dernière vérification

1 mars 2026

Plus d'information

Termes liés à cette étude

Autres numéros d'identification d'étude

  • K10349
  • 2024-I2M-CT-B-035 (Autre subvention/numéro de financement: CAMS Innovation Fund for Medical Sciences)
  • I-26PJ0568 (Autre identifiant: Ethics Committee, Peking Union Medical College Hospital)

Plan pour les données individuelles des participants (IPD)

Prévoyez-vous de partager les données individuelles des participants (DPI) ?

OUI

Description du régime IPD

L'ensemble de données d'évaluation de référence anonymisé, incluant des images d'échographie mammaire annotées par des experts avec des rapports de lecture BI-RADS appariés, est prévu pour une diffusion publique afin de promouvoir la reproductibilité académique et la recherche collaborative.

Délai de partage IPD

Dans les 6 mois suivant la publication principale, disponible indéfiniment

Critères d'accès au partage IPD

Accès ouvert via un dépôt de données reconnu (à déterminer)

Type d'informations de prise en charge du partage d'IPD

  • PROTOCOLE D'ÉTUDE
  • SÈVE
  • ANALYTIC_CODE

Informations sur les médicaments et les dispositifs, documents d'étude

Étudie un produit pharmaceutique réglementé par la FDA américaine

Non

Étudie un produit d'appareil réglementé par la FDA américaine

Non

Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .

S'abonner