Cette page a été traduite automatiquement et l'exactitude de la traduction n'est pas garantie. Veuillez vous référer au version anglaise pour un texte source.

Atténuation des biais d'automatisation dans le raisonnement diagnostique médecin-LLM grâce à des incitations comportementales

24 juin 2026 mis à jour par: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences

Atténuation des biais d'automatisation dans le raisonnement diagnostique des médecins avec les LLM à l'aide de nudges comportementaux

L'objectif de cet essai contrôlé randomisé est d'évaluer si des incitations comportementales peuvent réduire le biais d'automatisation, c'est-à-dire l'acceptation non critique des résultats automatisés, chez les médecins utilisant des modèles de langage de grande taille (LLM) comme ChatGPT-5.1 pour la prise de décision clinique.

La principale question à laquelle il cherche à répondre est : Une intervention comportementale à double mécanisme (ancrage de la précision de base plus des signaux de confiance codés par couleur spécifiques au cas) réduit-elle l'acceptation non critique par les médecins des recommandations incorrectes des LLM ?

Les chercheurs compareront les médecins qui reçoivent des recommandations de LLM accompagnées d'une incitation comportementale à ceux qui reçoivent des recommandations de LLM sans incitation pour évaluer si l'incitation réduit le biais d'automatisation.

Les participants :

  • Évalueront six vignettes cliniques accompagnées de recommandations générées par LLM (la moitié contenant des erreurs délibérées et cliniquement significatives).
  • Groupe témoin : Pourront visualiser les recommandations des LLM dans un format standard sans incitation.
  • Groupe traitement : Pourront visualiser la précision diagnostique de ChatGPT sur des ensembles de données médicales standard comme ancre initiale, puis recevoir des signaux de confiance codés par couleur à côté de chaque recommandation (par exemple, rouge pour une faible confiance).
  • Leurs réponses seront évaluées par des examinateurs en aveugle à l'aide d'une grille d'évaluation développée par des experts pour détecter l'acceptation non critique d'informations erronées.

Aperçu de l'étude

Statut

Complété

Les conditions

Description détaillée

Le biais d'automatisation représente un défi critique dans la pratique clinique moderne, en particulier à mesure que les outils d'intelligence artificielle (IA) s'intègrent de plus en plus dans les flux de travail des soins de santé. Ce phénomène cognitif décrit la tendance des cliniciens à favoriser les suggestions des systèmes de prise de décision automatisés, même lorsque ces suggestions sont incorrectes. Alors que les grands modèles de langage (LLM) tels que ChatGPT-5.1 gagnent du terrain dans les milieux médicaux, leur potentiel à réduire les erreurs et à améliorer l'efficacité doit être mis en balance avec une préoccupation majeure : ces modèles ne bénéficient pas d'une validation médicale rigoureuse et peuvent amplifier les biais cognitifs existants par des recommandations incorrectes ou trompeuses.

L'émergence du biais d'automatisation dans les contextes médicaux reflète une interaction complexe de facteurs environnementaux et psychologiques. Les contraintes de temps dans les environnements cliniques à haut volume créent une pression pour accepter les recommandations générées par l'IA sans examen adéquat. Les incitations financières qui privilégient l'efficacité au détriment de la minutie peuvent décourager davantage l'évaluation critique nécessaire à un jugement clinique solide. La fatigue cognitive pendant les longues gardes diminue la capacité des médecins à maintenir une pensée analytique soutenue. Ces pressions interagissent avec des mécanismes psychologiques, notamment la diffusion de la responsabilité, la confiance excessive dans les solutions technologiques et le déchargement cognitif, créant collectivement des conditions où l'acceptation non critique des recommandations générées par l'IA devient plus probable.

Cet essai contrôlé randomisé évalue l'efficacité d'une intervention comportementale de « nudge » conçue pour atténuer le biais d'automatisation chez les médecins utilisant des recommandations diagnostiques générées par des LLM. L'objectif principal est de déterminer si cette intervention améliore les scores de performance du raisonnement diagnostique lors de l'évaluation de vignettes cliniques incluant des recommandations de LLM délibérément erronées. Les objectifs secondaires incluent l'évaluation de l'influence du niveau d'expérience des médecins, du genre et de l'expérience préalable avec les LLM sur l'efficacité de l'intervention, ainsi que la détermination de l'efficacité différentielle pour les vignettes présentant différents signaux de confiance.

Cette étude utilise un essai contrôlé randomisé en simple aveugle avec deux bras parallèles. Les participants seront assignés aléatoirement 1:1 soit au bras d'intervention, soit au bras témoin. Pour éliminer la variabilité liée aux différences de compétences en formulation de requêtes, les participants n'interagiront pas directement avec une interface de LLM en temps réel. Au lieu de cela, tous les participants utiliseront une plateforme web personnalisée affichant des vignettes cliniques avec des recommandations de LLM pré-générées, garantissant un contenu généré par LLM identique pour chaque vignette.

Tous les participants évalueront six vignettes cliniques lors d'une session unique et supervisée d'environ 75 minutes. Trois vignettes contiendront des défauts de raisonnement clinique délibérément introduits dans les recommandations du LLM, tandis que trois contiendront des recommandations correctes. Les vignettes seront présentées dans un ordre aléatoire pour éviter la détection de motifs.

Les participants du bras témoin évalueront des vignettes cliniques avec des recommandations diagnostiques de LLM générées par ChatGPT, présentées dans un format texte standard et neutre, sans informations contextuelles supplémentaires. Les participants du bras d'intervention évalueront les mêmes vignettes accompagnées d'un « nudge » comportemental. Cette intervention consiste en deux indices cognitifs synchronisés : (1) un indice d'ancrage affichant la précision diagnostique de base de ChatGPT sur des ensembles de données médicales standards en haut du panneau de l'interface, ancrant explicitement les attentes sur la faillibilité du modèle, et (2) un indice d'attention sélective affichant la recommandation du LLM accompagnée d'un signal de confiance codé par couleur généré par une évaluation d'ensemble : trois LLM indépendants de pointe (Claude Sonnet 4.5, Gemini 2.5 Pro Thinking et GPT-5.1) fournissent chacun des évaluations de confiance pour la recommandation, et la confiance moyenne détermine la couleur du signal pour atténuer les erreurs de calibration d'un modèle unique.

Les signaux de confiance codés par couleur sont catégorisés en trois niveaux distincts basés sur la confiance moyenne de l'ensemble par rapport à la précision diagnostique de base. Les signaux rouges sont déclenchés lorsque la confiance moyenne est inférieure à la précision de base établie de ChatGPT, signalant explicitement les cas de forte incertitude qui exigent un examen critique accru. Les signaux orange indiquent que, bien que la confiance moyenne dépasse la moyenne de base, elle reste inférieure à 100 %, signalant la nécessité d'une vigilance clinique continue et d'éviter la complaisance. Enfin, les signaux verts sont réservés aux instances de consensus d'ensemble à 100 % ; cependant, même à ce niveau de confiance, les avertissements standards de sécurité de l'IA restent présents pour se prémunir contre une surdépendance à la sortie du système.

Les participants seront présentés avec six vignettes cliniques spécialement conçues pour mesurer le biais d'automatisation, issues et modifiées à partir de cas réels représentant une gamme de difficultés diagnostiques et de spécialités médicales courantes. Chaque vignette suit un format standardisé incluant la plainte principale, l'histoire de la maladie actuelle, les antécédents médicaux/sociaux/familiaux pertinents, les résultats de l'examen physique et les résultats de laboratoire initiaux.

Le critère de jugement principal est le Score de Performance du Raisonnement Diagnostique, un score composite en pourcentage basé sur une grille structurée évaluant : la qualité des diagnostics différentiels, les constatations à l'appui, les constatations opposées, l'exactitude du diagnostic final et la pertinence des prochaines étapes. Les critères de jugement secondaires incluent l'exactitude du diagnostic de premier choix (incorrect, partiellement correct ou correct). Toutes les réponses seront évaluées par des examinateurs en aveugle à l'aide de la grille d'évaluation.

Type d'étude

Interventionnel

Inscription (Réel)

72

Phase

  • N'est pas applicable

Contacts et emplacements

Cette section fournit les coordonnées de ceux qui mènent l'étude et des informations sur le lieu où cette étude est menée.

Lieux d'étude

    • Punjab Province
      • Lahore, Punjab Province, Pakistan, 54792
        • Lahore University of Management Sciences

Critères de participation

Les chercheurs recherchent des personnes qui correspondent à une certaine description, appelée critères d'éligibilité. Certains exemples de ces critères sont l'état de santé général d'une personne ou des traitements antérieurs.

Critère d'éligibilité

Âges éligibles pour étudier

  • Enfant
  • Adulte
  • Adulte plus âgé

Accepte les volontaires sains

Oui

La description

Critères d'inclusion :

  • Médecins entièrement ou provisoirement inscrits auprès du Conseil médical et dentaire du Pakistan (PMDC).
  • Avoir réussi l'examen de Bachelor of Medicine, Bachelor of Surgery (MBBS). L'équivalent du MBBS aux États-Unis et au Canada est le Doctor of Medicine (MD).
  • Les participants doivent avoir suivi un programme de formation structuré sur l'utilisation de ChatGPT (ou d'un modèle de langage de grande taille comparable), totalisant au moins 10 heures d'enseignement. Le programme doit inclure une pratique pratique liée aux aspects clés des LLM, spécifiquement l'ingénierie de prompts et l'évaluation de contenu.

Critères d'exclusion :

  • Tout autre médecin inscrit (entièrement ou provisoirement) auprès du PMDC (par exemple, les professionnels titulaires d'un Bachelor of Dental Surgery ou BDS).

Plan d'étude

Cette section fournit des détails sur le plan d'étude, y compris la façon dont l'étude est conçue et ce que l'étude mesure.

Comment l'étude est-elle conçue ?

Détails de conception

  • Objectif principal: Diagnostique
  • Répartition: Randomisé
  • Modèle interventionnel: Affectation parallèle
  • Masquage: Seul

Armes et Interventions

Groupe de participants / Bras
Intervention / Traitement
Comparateur actif: Recommandations ChatGPT accompagnées d'un coup de pouce comportemental
Les participants évalueront six vignettes cliniques. Au cours de l'essai, ils auront accès à des recommandations cliniques provenant d'un LLM spécifique et commercialement disponible (ChatGPT) en plus des ressources diagnostiques conventionnelles. Les recommandations du LLM pour trois vignettes contiendront des informations diagnostiques délibérément erronées et pour trois vignettes, elles contiendront des recommandations précises. Les cas seront présentés dans un ordre aléatoire. Les participants de ce bras recevront une incitation comportementale intégrée dans l'interface des recommandations du LLM qui présente deux indices cognitifs synchronisés lorsque le panneau du LLM est déployé : (1) un indice d'ancrage affichant la précision diagnostique de base de ChatGPT sur des ensembles de données médicaux standard en haut du panneau pour fixer des attentes réalistes avant l'intervention de l'indice située immédiatement en dessous, qui montre les recommandations du LLM accompagnées d'un signal de confiance spécifique au cas et codé par couleur.
Les participants du groupe de traitement recevront une intervention de rappel comportemental intégrée dans l'interface de recommandations du LLM, qui présente deux indices cognitifs synchronisés lorsque le panneau LLM est déployé : (1) un indice d'ancrage affichant la précision diagnostique de base de ChatGPT sur des ensembles de données médicales standards en haut du panneau, pour établir des attentes réalistes avant de consulter la recommandation spécifique, et (2) un indice d'attention sélective situé immédiatement en dessous, qui affiche la recommandation du LLM accompagnée d'un signal de confiance spécifique au cas et codé par couleur. Ce signal est catégorisé en rouge lorsque la confiance moyenne de l'ensemble tombe en dessous de la précision de base établie, signalant ainsi les cas à forte incertitude nécessitant une évaluation critique ; en orange lorsque la confiance atteint ou dépasse la ligne de base mais reste inférieure à 100%, visant à prévenir la complaisance et à maintenir une vigilance clinique active ; et en vert pour un consensus d'ensemble à 100%, bien que les avertissements de prudence standards s'appliquent toujours pour se prémunir contre les erreurs.
Aucune intervention: Recommandations de ChatGPT sans incitation comportementale
Les participants évalueront six vignettes cliniques. Pendant l'essai, ils auront accès aux recommandations cliniques d'un LLM spécifique et disponible dans le commerce (ChatGPT) en plus des ressources diagnostiques conventionnelles. Les recommandations du LLM pour trois vignettes contiendront des informations diagnostiques délibérément erronées. Les cas seront présentés dans un ordre aléatoire. Les participants de ce groupe ne recevront aucune incitation comportementale.

Que mesure l'étude ?

Principaux critères de jugement

Mesure des résultats
Description de la mesure
Délai
Score de précision du raisonnement diagnostique
Délai: Évalué à un moment unique pour chaque cas, pendant la séance d'évaluation du raisonnement diagnostique prévue, qui a lieu entre 0 et 5 jours après l'inclusion du participant.
Le critère d'évaluation principal sera le pourcentage de réponses correctes pour chaque cas, allant de 0 à 100 %, où des scores plus élevés indiquent une meilleure performance diagnostique. Pour chaque cas, les participants devront donner leurs trois principaux diagnostics, les éléments qui soutiennent chaque diagnostic et les éléments qui s'opposent à chaque diagnostic. Pour chaque diagnostic plausible, les participants recevront 1 point. Les éléments soutenant le diagnostic et les éléments s'opposant au diagnostic seront également notés en fonction de leur exactitude, avec 1 point pour chaque réponse correcte. Les participants devront ensuite nommer leur diagnostic principal qu'ils estiment le plus probable, gagnant 9 points pour une réponse raisonnable et 18 points pour la réponse la plus précise. Enfin, les participants devront nommer jusqu'à 3 prochaines étapes pour évaluer davantage le patient, avec 0,5 point attribué pour une réponse partiellement correcte et 1 point pour une réponse complètement correcte. Le critère d'évaluation principal sera comparé au niveau du cas entre les groupes randomisés.
Évalué à un moment unique pour chaque cas, pendant la séance d'évaluation du raisonnement diagnostique prévue, qui a lieu entre 0 et 5 jours après l'inclusion du participant.

Mesures de résultats secondaires

Mesure des résultats
Description de la mesure
Délai
Score de précision du diagnostic de premier choix
Délai: Évalué à un moment unique pour chaque cas, pendant la session d'évaluation du raisonnement diagnostique prévue, qui a lieu entre 0 et 5 jours après l'inclusion du participant.
Le critère d'évaluation secondaire mesurera la performance des participants à identifier le diagnostic le plus probable pour chaque vignette clinique. Après avoir évalué chaque cas, les participants sélectionneront leur diagnostic unique le plus probable, qui sera noté selon une Échelle de Précision Diagnostique à Trois Niveaux prédéfinie : 18 points pour le diagnostic le plus précis, 9 points pour une alternative cliniquement raisonnable, et 0 point pour un diagnostic incorrect. Pour chaque participant, un Score de Précision du Diagnostic de Premier Choix est calculé comme (points totaux obtenus ÷ points maximum possibles) × 100, donnant une plage de 0 à 100 % où des scores plus élevés indiquent une plus grande précision diagnostique. Ce score en pourcentage sera comparé au niveau du cas entre les groupes randomisés pour quantifier l'impact du biais d'automatisation sur la prise de décision diagnostique.
Évalué à un moment unique pour chaque cas, pendant la session d'évaluation du raisonnement diagnostique prévue, qui a lieu entre 0 et 5 jours après l'inclusion du participant.

Collaborateurs et enquêteurs

C'est ici que vous trouverez les personnes et les organisations impliquées dans cette étude.

Les enquêteurs

  • Chercheur principal: Muhammad Asadullah Khawaja, MBBS, King Edward Medical University
  • Chercheur principal: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences (LUMS)
  • Chercheur principal: Ali Zafar Sheikh, MBBS, Lahore General Hospital
  • Chercheur principal: Muhammad Junaid Akhtar, MBBS, Children's Hospital, Lahore
  • Chercheur principal: Muhammad Hamad Alizai, PhD, Lahore University of Management Sciences (LUMS)

Dates d'enregistrement des études

Ces dates suivent la progression des dossiers d'étude et des soumissions de résultats sommaires à ClinicalTrials.gov. Les dossiers d'étude et les résultats rapportés sont examinés par la Bibliothèque nationale de médecine (NLM) pour s'assurer qu'ils répondent à des normes de contrôle de qualité spécifiques avant d'être publiés sur le site Web public.

Dates principales de l'étude

Début de l'étude (Réel)

17 janvier 2026

Achèvement primaire (Réel)

25 mai 2026

Achèvement de l'étude (Réel)

26 mai 2026

Dates d'inscription aux études

Première soumission

26 décembre 2025

Première soumission répondant aux critères de contrôle qualité

26 décembre 2025

Première publication (Réel)

9 janvier 2026

Mises à jour des dossiers d'étude

Dernière mise à jour publiée (Réel)

25 juin 2026

Dernière mise à jour soumise répondant aux critères de contrôle qualité

24 juin 2026

Dernière vérification

1 juin 2026

Plus d'information

Termes liés à cette étude

Plan pour les données individuelles des participants (IPD)

Prévoyez-vous de partager les données individuelles des participants (DPI) ?

NON

Informations sur les médicaments et les dispositifs, documents d'étude

Étudie un produit pharmaceutique réglementé par la FDA américaine

Non

Étudie un produit d'appareil réglementé par la FDA américaine

Non

Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .

S'abonner