Cette page a été traduite automatiquement et l'exactitude de la traduction n'est pas garantie. Veuillez vous référer au version anglaise pour un texte source.

Supervision Clinique Évolutive des Grands Modèles de Langage par Triangulation d'Incertitude (SCOUT)

14 février 2026 mis à jour par: China National Center for Cardiovascular Diseases

Évaluation prospective d'un cadre métavérification indépendant du modèle (SCOUT) pour la surveillance clinique évolutive des sorties de grands modèles de langage dans le diagnostic des maladies coronariennes : un essai croisé randomisé multi-lecteurs

Cette étude prospective, multi-lecteurs, randomisée en cross-over évalue SCOUT (Scalable Clinical Oversight via Uncertainty Triangulation), un cadre méta-vérification indépendant des modèles qui diffère sélectivement les prédictions peu fiables des grands modèles de langage (LLM) aux cliniciens en triangulant trois signaux d'incertitude orthogonaux : l'hétérogénéité des modèles, l'incohérence stochastique et la critique du raisonnement. L'étude évalue si la revue assistée par SCOUT peut réduire le temps de revue médicale par rapport à la revue manuelle standard des diagnostics générés par l'IA tout en maintenant une précision diagnostique non inférieure dans le sous-typage des maladies coronariennes (CHD).

Aperçu de l'étude

Description détaillée

Contexte : Les grands modèles de langage sont de plus en plus déployés dans les flux de travail cliniques, mais exiger une revue clinique de chaque sortie d'IA annule les gains d'efficacité qui motivent leur adoption. SCOUT aborde ce paradoxe efficacité-sécurité par une méta-vérification algorithmique.

Le cadre SCOUT triangule trois signaux externes orthogonaux pour déterminer l'incertitude au niveau du cas : (1) Hétérogénéité du modèle - si un LLM auxiliaire structurellement différent est d'accord avec le modèle principal ; (2) Incohérence stochastique - si un échantillonnage répété du même modèle produit des sorties divergentes ; (3) Critique du raisonnement - si un modèle vérificateur externe identifie des failles logiques dans le raisonnement en chaîne de pensée.

Dans cet essai croisé, 7 cliniciens de niveaux d'ancienneté variés (2 résidents juniors, 3 résidents seniors, 2 médecins traitants) examinent chacun les 110 cas selon les deux flux de travail : revue manuelle standard et revue assistée par SCOUT. L'étude évalue l'efficacité du flux de travail (critère d'évaluation principal) et la précision diagnostique (critère d'évaluation secondaire).

Type d'étude

Interventionnel

Inscription (Estimé)

7

Phase

  • N'est pas applicable

Contacts et emplacements

Cette section fournit les coordonnées de ceux qui mènent l'étude et des informations sur le lieu où cette étude est menée.

Coordonnées de l'étude

Critères de participation

Les chercheurs recherchent des personnes qui correspondent à une certaine description, appelée critères d'éligibilité. Certains exemples de ces critères sont l'état de santé général d'une personne ou des traitements antérieurs.

Critère d'éligibilité

Âges éligibles pour étudier

  • Adulte
  • Adulte plus âgé

Accepte les volontaires sains

Non

La description

Critères d'inclusion :

  • Cardiologues certifiés ou en formation à l'Hôpital Fuwai
  • Couverture de trois niveaux d'expérience : résidents juniors, résidents seniors, médecins traitants

Critères d'exclusion :

  • Cliniciens impliqués dans le développement ou l'optimisation du cadre SCOUT
  • Cliniciens impliqués dans le processus d'arbitrage de référence

Plan d'étude

Cette section fournit des détails sur le plan d'étude, y compris la façon dont l'étude est conçue et ce que l'étude mesure.

Comment l'étude est-elle conçue ?

Détails de conception

  • Objectif principal: Diagnostique
  • Répartition: Randomisé
  • Modèle interventionnel: Affectation croisée
  • Masquage: Aucun (étiquette ouverte)

Armes et Interventions

Groupe de participants / Bras
Intervention / Traitement
Comparateur actif: Contrôle (Révision manuelle standard)
Les médecins examinent manuellement tous les cas de l'ensemble témoin (n=54) avec accès aux prédictions et au raisonnement de l'IA. Aucun report sélectif.
Les médecins effectuent un examen manuel complet de 54 cas en utilisant des dossiers médicaux bruts avec accès aux prédictions et au raisonnement du modèle d'IA, mais sans stratification de l'incertitude SCOUT ni report sélectif.
Expérimental: Expérimental (Examen Assisté SCOUT)
Les médecins traitent l'ensemble d'intervention (n=56) via le cadre SCOUT. Les cas à faible incertitude sont automatiquement acceptés ; les cas à forte incertitude font l'objet d'un examen médical avec une piste d'audit complète.
Révision assistée par SCOUT (Bras d'intervention) : Les médecins examinent 56 cas traités via le cadre SCOUT. Pour les cas classés comme à faible incertitude (D(x)=0), la prédiction de l'IA est automatiquement acceptée sans révision par le médecin. Pour les cas à forte incertitude (D(x)=1), le médecin examine le cas avec accès au raisonnement en chaîne de pensées du modèle principal et aux résultats de l'audit de méta-vérification. Le modèle principal est DeepSeek-V3.1 avec incitation au raisonnement en chaîne de pensées.

Que mesure l'étude ?

Principaux critères de jugement

Mesure des résultats
Description de la mesure
Délai
Temps moyen d'examen par cas par le médecin (minutes)
Délai: Jusqu'à la fin de l'étude, une moyenne de 2 heures.
Durée moyenne passée par chaque clinicien pour examiner et rendre une décision diagnostique par cas dans chaque bras d'étude. Mesurée en minutes.
Jusqu'à la fin de l'étude, une moyenne de 2 heures.

Mesures de résultats secondaires

Mesure des résultats
Description de la mesure
Délai
Précision diagnostique (%)
Délai: Jusqu'à la fin de l'étude, en moyenne 2 heures.
Proportion de classifications correctes des sous-types de CHD (STEMI, NSTEMI, angor instable, syndromes coronariens chroniques) dans chaque bras.
Jusqu'à la fin de l'étude, en moyenne 2 heures.
Retour sur investissement informatique (ROI)
Délai: Jusqu'à la fin de l'étude, en moyenne 2 heures.
Ratio d'économies de temps médical (évaluées au tarif minute standardisé des références de la réforme sanitaire de Sanming) par rapport au coût informatique de l'inférence SCOUT, stratifié par niveau d'ancienneté du clinicien.
Jusqu'à la fin de l'étude, en moyenne 2 heures.

Collaborateurs et enquêteurs

C'est ici que vous trouverez les personnes et les organisations impliquées dans cette étude.

Dates d'enregistrement des études

Ces dates suivent la progression des dossiers d'étude et des soumissions de résultats sommaires à ClinicalTrials.gov. Les dossiers d'étude et les résultats rapportés sont examinés par la Bibliothèque nationale de médecine (NLM) pour s'assurer qu'ils répondent à des normes de contrôle de qualité spécifiques avant d'être publiés sur le site Web public.

Dates principales de l'étude

Début de l'étude (Estimé)

19 février 2026

Achèvement primaire (Estimé)

28 février 2026

Achèvement de l'étude (Estimé)

28 février 2026

Dates d'inscription aux études

Première soumission

9 février 2026

Première soumission répondant aux critères de contrôle qualité

14 février 2026

Première publication (Réel)

17 février 2026

Mises à jour des dossiers d'étude

Dernière mise à jour publiée (Réel)

17 février 2026

Dernière mise à jour soumise répondant aux critères de contrôle qualité

14 février 2026

Dernière vérification

1 février 2026

Plus d'information

Termes liés à cette étude

Autres numéros d'identification d'étude

  • 2025-2702-1

Plan pour les données individuelles des participants (IPD)

Prévoyez-vous de partager les données individuelles des participants (DPI) ?

OUI

Description du régime IPD

Les données individuelles des participants anonymisées sous-jacentes aux résultats rapportés dans cette étude seront rendues disponibles.

Délai de partage IPD

À partir de 1 mois après la publication des résultats principaux et disponible jusqu'à 60 mois.

Critères d'accès au partage IPD

Les données sont disponibles auprès de l'auteur correspondant sur demande raisonnable. Les demandeurs devront fournir une proposition de recherche méthodologiquement solide et signer un accord d'utilisation des données.

Type d'informations de prise en charge du partage d'IPD

  • PROTOCOLE D'ÉTUDE
  • SÈVE
  • CIF
  • ANALYTIC_CODE
  • RSE

Informations sur les médicaments et les dispositifs, documents d'étude

Étudie un produit pharmaceutique réglementé par la FDA américaine

Non

Étudie un produit d'appareil réglementé par la FDA américaine

Non

Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .

S'abonner