- ICH GCP
- Registre américain des essais cliniques
- Essai clinique NCT06911645
Raisonnement de diagnostic avec modèle GPT-4 personnalisé
Évaluation de la performance des LLM et des cliniciens dans des cas de diagnostic complexes: un essai contrôlé randomisé
Aperçu de l'étude
Statut
Les conditions
Description détaillée
Les technologies de l'intelligence artificielle (IA), en particulier les modèles de grande langue avancés comme le chatppt d'Openai, ont le potentiel d'améliorer la prise de décision médicale. Bien que ChatGPT-4 n'ait pas été spécialement conçu pour les applications médicales, il a été promis dans divers contextes de soins de santé, y compris l'écriture médicale des notes, la lutte contre les demandes des patients et la facilitation des consultations médicales. Cependant, son impact sur le raisonnement diagnostique des cliniciens reste largement inconnu.
Le raisonnement clinique est un processus complexe qui implique la reconnaissance des modèles, l'application des connaissances et le raisonnement probabiliste. L'intégration d'outils d'IA comme ChatGPT-4 dans les flux de travail des médecins pourrait aider à réduire la charge de travail des cliniciens et à réduire la probabilité de diagnostics manqués. Cependant, ChatGPT-4 n'a été ni développé ni validé pour le raisonnement diagnostique, et il peut produire des informations trompeuses, y compris des conclusions plausibles mais incorrectes qui pourraient tromper les cliniciens. S'il n'est pas utilisé de manière appropriée, il peut ne pas s'améliorer et pourrait même entraver la prise de décision clinique. Par conséquent, il est essentiel d'étudier comment les cliniciens utilisent de grands modèles de langage pour soutenir le raisonnement clinique avant de les intégrer dans les soins de routine des patients.
Cette étude examinera comment l'accès immédiat à une version personnalisée de ChatGPT-4 a un impact sur les performances sur les tâches de raisonnement de diagnostic basées sur les cas, par rapport à une approche par étapes. Dans l'approche par étapes, les participants utiliseront d'abord des outils d'aide à la décision de diagnostic traditionnels pour soutenir leur raisonnement de cas avant d'interagir avec un modèle ChatGPT-4 personnalisé, à quel point ils auront la possibilité de réviser leurs réponses initiales.
Les participants seront randomisés dans différents bras d'étude et répondront aux cas de diagnostic en fournissant trois diagnostics différentiels, ainsi que des résultats de soutien et d'opposition pour chacun. Ils identifieront également leur diagnostic le plus élevé et proposeront les prochaines étapes de diagnostic. Les examinateurs indépendants, aveuglés à l'attribution de traitement, évalueront leurs réponses.
Type d'étude
Inscription (Réel)
Phase
- N'est pas applicable
Contacts et emplacements
Lieux d'étude
-
-
California
-
Palo Alto, California, États-Unis, 94305
- Stanford University
-
-
Critères de participation
Critère d'éligibilité
Âges éligibles pour étudier
- Enfant
- Adulte
- Adulte plus âgé
Accepte les volontaires sains
La description
Critères d'inclusion:
- Les participants doivent être des médecins agréés et ont terminé au moins l'année 1 après le cycle (PGY1) de la formation médicale.
- Formation en médecine interne, en médecine familiale ou en médecine d'urgence.
Critères d'exclusion:
- Pas actuellement pratiquant cliniquement.
- J'ai participé à l'une de nos études précédentes qui ont utilisé les six mêmes cas de diagnostic.
Plan d'étude
Comment l'étude est-elle conçue ?
Détails de conception
- Objectif principal: Diagnostique
- Répartition: Randomisé
- Modèle interventionnel: Affectation parallèle
- Masquage: Seul
Armes et Interventions
Groupe de participants / Bras |
Intervention / Traitement |
|---|---|
|
Comparateur actif: Accès immédiat à la version personnalisée de GPT-4
Le groupe sera encouragé à utiliser immédiatement une version personnalisée de GPT-4.
|
Le groupe a un accès immédiat à une version personnalisée de GPT-4 pour soutenir son raisonnement de diagnostic pour chaque cas.
|
|
Comparateur actif: Ressources conventionnelles d'abord, puis a accordé l'accès à la version personnalisée de GPT-4.
Le groupe sera encouragé à utiliser d'abord toutes les ressources qu'ils souhaitent en plus de modèles de langue importants (Uptodate, PubMed, Google, etc.), puis auront accès à une version personnalisée de GPT-4.
|
Le groupe est d'abord encouragé à raisonner à travers des cas de diagnostic avec le soutien des ressources conventionnelles.
Après avoir soumis les réponses d'un cas, ils ont ensuite accès à une version personnalisée de GPT-4 et ont la possibilité de modifier leurs réponses initiales.
|
Que mesure l'étude ?
Principaux critères de jugement
Mesure des résultats |
Description de la mesure |
Délai |
|---|---|---|
|
Raisonnement de diagnostic
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
Le résultat principal sera le pourcentage de réponses correctes par cas (plage: 0 à 100).
Pour chaque cas, les participants seront invités à fournir leurs trois principaux diagnostics différentiels, ainsi que des résultats de soutien et d'opposition pour chacun.
Ils recevront 1 point pour chaque diagnostic plausible.
Les résultats de soutien et d'opposition seront classés en fonction de l'exactitude, avec 1 point pour une réponse partiellement correcte et 2 points pour une réponse complètement correcte.
Les participants sélectionneront ensuite leur diagnostic supérieur, gagnant 1 point pour un choix raisonnable et 2 points pour le diagnostic le plus précis.
Enfin, ils répertorieront jusqu'à trois prochaines étapes pour une évaluation plus approfondie des patients, avec 1 point attribué pour une réponse partiellement correcte et 2 points pour une réponse complètement correcte.
Le résultat principal sera analysé au niveau du cas, en comparant les performances entre les groupes d'étude randomisés.
|
Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
Mesures de résultats secondaires
Mesure des résultats |
Description de la mesure |
Délai |
|---|---|---|
|
Temps passé par cas
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
Les enquêteurs compareront le temps moyen (en quelques minutes) les participants passent sur chaque cas à travers les deux bras de l'étude.
|
Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
|
Fréquence rapide
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
Les enquêteurs compareront la fréquence des invites des participants au modèle GPT-4 personnalisé entre les deux groupes d'étude.
|
Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
|
Sentiment
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
Les enquêteurs compareront le ton et le sentiment des invites des participants au modèle GPT-4 personnalisé dans les deux groupes d'étude.
Les enquêteurs créeront un système de codage qualitatif pour classer la nature des invites des participants.
|
Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
|
Perceptions des participants de l'IA dans le raisonnement clinique
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
Ce résultat serait évalué dans les deux armes de l'étude et engloberait les changements dans les attitudes, la confiance et la volonté d'utiliser des outils de diagnostic d'IA avant et après avoir été exposé à l'outil personnalisé.
Nous évaluerons le nombre de participants qui étaient ouverts à l'utilisation de l'IA pour aider à un raisonnement clinique complexe (pré- et post-quiz), s'ils aimaient travailler avec l'outil de diagnostic de l'IA, s'ils se sentaient comme si l'outil offrait une expérience de collaboration précieuse pour le raisonnement clinique, s'ils voyaient l'outil de diagnostic de l'IA de l'IA augmentaient leur confiance dans leur étude différentielle.
Ceux-ci seront évalués sur une échelle de Likert classé de fortement en désaccord à fortement d'accord.
|
Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
|
Raisonnement de diagnostic de GPT-4 personnalisé
Délai: Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
Les diagnostics «indépendants» personnalisés du GPT-4 seront évalués pour la précision.
Le résultat sera le pourcentage de réponses correctes par cas (plage: 0 à 100).
Pour chaque cas, le méta-réparateur dirige le GPT-4 personnalisé pour fournir ses trois principaux diagnostics différentiels, ainsi que des résultats de soutien et d'opposition pour chacun, un diagnostic final et des étapes suivantes.
Le GPT-4 personnalisé recevra 1 point pour chaque diagnostic plausible.
Les résultats de soutien et d'opposition seront classés en fonction de l'exactitude, avec 1 point pour une réponse partiellement correcte et 2 points pour une réponse complètement correcte.
Son diagnostic supérieur gagnera 1 point pour un choix raisonnable et 2 points pour le diagnostic le plus précis.
Enfin, il répertorie jusqu'à trois prochaines étapes pour une évaluation plus approfondie des patients, avec 1 point attribué pour une réponse partiellement correcte et 2 points pour une réponse complètement correcte.
Le résultat sera analysé au niveau du cas, en comparant les performances avec les scores des groupes d'étude randomisés.
|
Grâce à l'achèvement de l'étude, en moyenne 6 mois
|
Collaborateurs et enquêteurs
Parrainer
Collaborateurs
Les enquêteurs
- Chercheur principal: Jonathan H Chen, MD, PhD, Stanford University
Dates d'enregistrement des études
Dates principales de l'étude
Début de l'étude (Réel)
Achèvement primaire (Réel)
Achèvement de l'étude (Réel)
Dates d'inscription aux études
Première soumission
Première soumission répondant aux critères de contrôle qualité
Première publication (Réel)
Mises à jour des dossiers d'étude
Dernière mise à jour publiée (Réel)
Dernière mise à jour soumise répondant aux critères de contrôle qualité
Dernière vérification
Plus d'information
Termes liés à cette étude
Termes MeSH pertinents supplémentaires
Autres numéros d'identification d'étude
- 71319c
Plan pour les données individuelles des participants (IPD)
Prévoyez-vous de partager les données individuelles des participants (DPI) ?
Informations sur les médicaments et les dispositifs, documents d'étude
Étudie un produit pharmaceutique réglementé par la FDA américaine
Étudie un produit d'appareil réglementé par la FDA américaine
produit fabriqué et exporté des États-Unis.
Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .