Cette page a été traduite automatiquement et l'exactitude de la traduction n'est pas garantie. Veuillez vous référer au version anglaise pour un texte source.

Raisonnement de diagnostic avec modèle GPT-4 personnalisé

27 mars 2025 mis à jour par: Jonathan Chen, Stanford University

Évaluation de la performance des LLM et des cliniciens dans des cas de diagnostic complexes: un essai contrôlé randomisé

Cette étude évaluera l'impact de l'accès immédiat à une version personnalisée de GPT-4, un modèle grand langage, sur les performances des tâches de raisonnement de diagnostic basées sur des cas. Plus précisément, il comparera cette approche à un processus en deux étapes où les participants utilisent d'abord les outils d'aide à la décision de diagnostic traditionnels pour soutenir leur raisonnement de diagnostic avant d'avoir accès au modèle GPT-4 personnalisé.

Aperçu de l'étude

Description détaillée

Les technologies de l'intelligence artificielle (IA), en particulier les modèles de grande langue avancés comme le chatppt d'Openai, ont le potentiel d'améliorer la prise de décision médicale. Bien que ChatGPT-4 n'ait pas été spécialement conçu pour les applications médicales, il a été promis dans divers contextes de soins de santé, y compris l'écriture médicale des notes, la lutte contre les demandes des patients et la facilitation des consultations médicales. Cependant, son impact sur le raisonnement diagnostique des cliniciens reste largement inconnu.

Le raisonnement clinique est un processus complexe qui implique la reconnaissance des modèles, l'application des connaissances et le raisonnement probabiliste. L'intégration d'outils d'IA comme ChatGPT-4 dans les flux de travail des médecins pourrait aider à réduire la charge de travail des cliniciens et à réduire la probabilité de diagnostics manqués. Cependant, ChatGPT-4 n'a été ni développé ni validé pour le raisonnement diagnostique, et il peut produire des informations trompeuses, y compris des conclusions plausibles mais incorrectes qui pourraient tromper les cliniciens. S'il n'est pas utilisé de manière appropriée, il peut ne pas s'améliorer et pourrait même entraver la prise de décision clinique. Par conséquent, il est essentiel d'étudier comment les cliniciens utilisent de grands modèles de langage pour soutenir le raisonnement clinique avant de les intégrer dans les soins de routine des patients.

Cette étude examinera comment l'accès immédiat à une version personnalisée de ChatGPT-4 a un impact sur les performances sur les tâches de raisonnement de diagnostic basées sur les cas, par rapport à une approche par étapes. Dans l'approche par étapes, les participants utiliseront d'abord des outils d'aide à la décision de diagnostic traditionnels pour soutenir leur raisonnement de cas avant d'interagir avec un modèle ChatGPT-4 personnalisé, à quel point ils auront la possibilité de réviser leurs réponses initiales.

Les participants seront randomisés dans différents bras d'étude et répondront aux cas de diagnostic en fournissant trois diagnostics différentiels, ainsi que des résultats de soutien et d'opposition pour chacun. Ils identifieront également leur diagnostic le plus élevé et proposeront les prochaines étapes de diagnostic. Les examinateurs indépendants, aveuglés à l'attribution de traitement, évalueront leurs réponses.

Type d'étude

Interventionnel

Inscription (Réel)

70

Phase

  • N'est pas applicable

Contacts et emplacements

Cette section fournit les coordonnées de ceux qui mènent l'étude et des informations sur le lieu où cette étude est menée.

Lieux d'étude

    • California
      • Palo Alto, California, États-Unis, 94305
        • Stanford University

Critères de participation

Les chercheurs recherchent des personnes qui correspondent à une certaine description, appelée critères d'éligibilité. Certains exemples de ces critères sont l'état de santé général d'une personne ou des traitements antérieurs.

Critère d'éligibilité

Âges éligibles pour étudier

  • Enfant
  • Adulte
  • Adulte plus âgé

Accepte les volontaires sains

Oui

La description

Critères d'inclusion:

  • Les participants doivent être des médecins agréés et ont terminé au moins l'année 1 après le cycle (PGY1) de la formation médicale.
  • Formation en médecine interne, en médecine familiale ou en médecine d'urgence.

Critères d'exclusion:

  • Pas actuellement pratiquant cliniquement.
  • J'ai participé à l'une de nos études précédentes qui ont utilisé les six mêmes cas de diagnostic.

Plan d'étude

Cette section fournit des détails sur le plan d'étude, y compris la façon dont l'étude est conçue et ce que l'étude mesure.

Comment l'étude est-elle conçue ?

Détails de conception

  • Objectif principal: Diagnostique
  • Répartition: Randomisé
  • Modèle interventionnel: Affectation parallèle
  • Masquage: Seul

Armes et Interventions

Groupe de participants / Bras
Intervention / Traitement
Comparateur actif: Accès immédiat à la version personnalisée de GPT-4
Le groupe sera encouragé à utiliser immédiatement une version personnalisée de GPT-4.
Le groupe a un accès immédiat à une version personnalisée de GPT-4 pour soutenir son raisonnement de diagnostic pour chaque cas.
Comparateur actif: Ressources conventionnelles d'abord, puis a accordé l'accès à la version personnalisée de GPT-4.
Le groupe sera encouragé à utiliser d'abord toutes les ressources qu'ils souhaitent en plus de modèles de langue importants (Uptodate, PubMed, Google, etc.), puis auront accès à une version personnalisée de GPT-4.
Le groupe est d'abord encouragé à raisonner à travers des cas de diagnostic avec le soutien des ressources conventionnelles. Après avoir soumis les réponses d'un cas, ils ont ensuite accès à une version personnalisée de GPT-4 et ont la possibilité de modifier leurs réponses initiales.

Que mesure l'étude ?

Principaux critères de jugement

Mesure des résultats
Description de la mesure
Délai
Raisonnement de diagnostic
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
Le résultat principal sera le pourcentage de réponses correctes par cas (plage: 0 à 100). Pour chaque cas, les participants seront invités à fournir leurs trois principaux diagnostics différentiels, ainsi que des résultats de soutien et d'opposition pour chacun. Ils recevront 1 point pour chaque diagnostic plausible. Les résultats de soutien et d'opposition seront classés en fonction de l'exactitude, avec 1 point pour une réponse partiellement correcte et 2 points pour une réponse complètement correcte. Les participants sélectionneront ensuite leur diagnostic supérieur, gagnant 1 point pour un choix raisonnable et 2 points pour le diagnostic le plus précis. Enfin, ils répertorieront jusqu'à trois prochaines étapes pour une évaluation plus approfondie des patients, avec 1 point attribué pour une réponse partiellement correcte et 2 points pour une réponse complètement correcte. Le résultat principal sera analysé au niveau du cas, en comparant les performances entre les groupes d'étude randomisés.
Grâce à l'achèvement de l'étude, en moyenne 6 mois

Mesures de résultats secondaires

Mesure des résultats
Description de la mesure
Délai
Temps passé par cas
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
Les enquêteurs compareront le temps moyen (en quelques minutes) les participants passent sur chaque cas à travers les deux bras de l'étude.
Grâce à l'achèvement de l'étude, en moyenne 6 mois
Fréquence rapide
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
Les enquêteurs compareront la fréquence des invites des participants au modèle GPT-4 personnalisé entre les deux groupes d'étude.
Grâce à l'achèvement de l'étude, en moyenne 6 mois
Sentiment
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
Les enquêteurs compareront le ton et le sentiment des invites des participants au modèle GPT-4 personnalisé dans les deux groupes d'étude. Les enquêteurs créeront un système de codage qualitatif pour classer la nature des invites des participants.
Grâce à l'achèvement de l'étude, en moyenne 6 mois
Perceptions des participants de l'IA dans le raisonnement clinique
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
Ce résultat serait évalué dans les deux armes de l'étude et engloberait les changements dans les attitudes, la confiance et la volonté d'utiliser des outils de diagnostic d'IA avant et après avoir été exposé à l'outil personnalisé. Nous évaluerons le nombre de participants qui étaient ouverts à l'utilisation de l'IA pour aider à un raisonnement clinique complexe (pré- et post-quiz), s'ils aimaient travailler avec l'outil de diagnostic de l'IA, s'ils se sentaient comme si l'outil offrait une expérience de collaboration précieuse pour le raisonnement clinique, s'ils voyaient l'outil de diagnostic de l'IA de l'IA augmentaient leur confiance dans leur étude différentielle. Ceux-ci seront évalués sur une échelle de Likert classé de fortement en désaccord à fortement d'accord.
Grâce à l'achèvement de l'étude, en moyenne 6 mois
Raisonnement de diagnostic de GPT-4 personnalisé
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
Les diagnostics «indépendants» personnalisés du GPT-4 seront évalués pour la précision. Le résultat sera le pourcentage de réponses correctes par cas (plage: 0 à 100). Pour chaque cas, le méta-réparateur dirige le GPT-4 personnalisé pour fournir ses trois principaux diagnostics différentiels, ainsi que des résultats de soutien et d'opposition pour chacun, un diagnostic final et des étapes suivantes. Le GPT-4 personnalisé recevra 1 point pour chaque diagnostic plausible. Les résultats de soutien et d'opposition seront classés en fonction de l'exactitude, avec 1 point pour une réponse partiellement correcte et 2 points pour une réponse complètement correcte. Son diagnostic supérieur gagnera 1 point pour un choix raisonnable et 2 points pour le diagnostic le plus précis. Enfin, il répertorie jusqu'à trois prochaines étapes pour une évaluation plus approfondie des patients, avec 1 point attribué pour une réponse partiellement correcte et 2 points pour une réponse complètement correcte. Le résultat sera analysé au niveau du cas, en comparant les performances avec les scores des groupes d'étude randomisés.
Grâce à l'achèvement de l'étude, en moyenne 6 mois

Collaborateurs et enquêteurs

C'est ici que vous trouverez les personnes et les organisations impliquées dans cette étude.

Les enquêteurs

  • Chercheur principal: Jonathan H Chen, MD, PhD, Stanford University

Dates d'enregistrement des études

Ces dates suivent la progression des dossiers d'étude et des soumissions de résultats sommaires à ClinicalTrials.gov. Les dossiers d'étude et les résultats rapportés sont examinés par la Bibliothèque nationale de médecine (NLM) pour s'assurer qu'ils répondent à des normes de contrôle de qualité spécifiques avant d'être publiés sur le site Web public.

Dates principales de l'étude

Début de l'étude (Réel)

16 décembre 2024

Achèvement primaire (Réel)

24 janvier 2025

Achèvement de l'étude (Réel)

24 janvier 2025

Dates d'inscription aux études

Première soumission

11 février 2025

Première soumission répondant aux critères de contrôle qualité

27 mars 2025

Première publication (Réel)

4 avril 2025

Mises à jour des dossiers d'étude

Dernière mise à jour publiée (Réel)

4 avril 2025

Dernière mise à jour soumise répondant aux critères de contrôle qualité

27 mars 2025

Dernière vérification

1 mars 2025

Plus d'information

Termes liés à cette étude

Termes MeSH pertinents supplémentaires

Autres numéros d'identification d'étude

  • 71319c

Plan pour les données individuelles des participants (IPD)

Prévoyez-vous de partager les données individuelles des participants (DPI) ?

NON

Informations sur les médicaments et les dispositifs, documents d'étude

Étudie un produit pharmaceutique réglementé par la FDA américaine

Non

Étudie un produit d'appareil réglementé par la FDA américaine

Non

produit fabriqué et exporté des États-Unis.

Non

Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .

S'abonner