Cette page a été traduite automatiquement et l'exactitude de la traduction n'est pas garantie. Veuillez vous référer au version anglaise pour un texte source.

Enrichissement du Raisonnement par Rétroaction de l'IA dans l'Essai de Néphrologie (REFINe)

12 janvier 2026 mis à jour par: Aghiles.HAMROUN, University Hospital, Lille

Amélioration du Raisonnement avec Rétroaction d'une IA Générative en Néphrologie (REFINe) : Évaluation Randomisée du Soutien par IA Générative dans le Diagnostic Néphrologique

L'objectif de cet essai clinique est d'étudier comment l'intelligence artificielle (IA) peut aider les médecins à établir des diagnostics en néphrologie. Les chercheurs souhaitent savoir si un outil d'IA appelé modèle de langage de grande taille (LLM) peut aider les médecins à choisir plus souvent le diagnostic correct et à se sentir plus confiants dans leurs réponses.

Avant de commencer l'étude, l'équipe de recherche a testé plusieurs modèles d'IA et a choisi l'un des plus performants, un modèle de classe GPT-5 configuré pour utiliser un effort de raisonnement élevé.

Les principales questions que cette étude vise à répondre sont :

  1. Les médecins établissent-ils plus de diagnostics corrects lorsqu'ils peuvent voir les suggestions de l'IA ?
  2. Le fait de voir les suggestions de l'IA modifie-t-il la confiance des médecins dans leur diagnostic ?

Les chercheurs compareront les médecins qui reçoivent des suggestions d'IA avec ceux qui n'en reçoivent pas pour voir comment l'IA affecte la précision, la confiance et la prise de décision.

Les participants traiteront jusqu'à 10 cas cliniques en ligne. Pour chaque cas, ils devront :

  1. Lire un bref scénario médical
  2. Suggérer jusqu'à trois diagnostics possibles

(S'ils sont dans le groupe IA) Examiner les suggestions de l'IA et décider s'ils modifient leur réponse

L'étudiera également le temps que les participants mettent à répondre à chaque cas et comparera les performances de l'IA avec les réponses humaines.

Aperçu de l'étude

Description détaillée

Cette étude évalue si la fourniture aux cliniciens de suggestions diagnostiques en temps réel provenant d'un grand modèle de langage à raisonnement élevé (GPT-5) améliore la précision diagnostique, la confiance et l'efficacité lors de la résolution de vignettes cliniques en néphrologie. Avant de sélectionner le modèle pour l'essai, l'équipe de recherche a évalué plusieurs modèles de pointe sur un ensemble pilote de cas de néphrologie, notamment : GPT-5, GPT-5-mini, O3, GPT-4o, Llama-4 Maverick-17B, Gemini-2.5-Pro, Qwen-3 VL-235B Thinking, DeepSeek-V3.2-Exp, MedGEMMA-27B, Claude Sonnet-4.5 et Magistral-Medium-2509. GPT-5 (raisonnement élevé) a démontré les performances diagnostiques, la stabilité et l'interprétabilité les plus élevées, et a été sélectionné comme système d'IA utilisé dans le bras d'intervention.

Les participants comprennent des étudiants en médecine, des résidents, des fellows et des médecins en exercice. Après avoir créé un compte, les participants remplissent un questionnaire démographique (spécialité, années d'expérience, type de pratique, catégorie d'âge, familiarité avec l'IA) et doivent explicitement accepter l'utilisation de ces données à des fins de recherche avant d'accéder aux vignettes. Aucune information directement identifiable n'est collectée.

Les participants sont randomisés (avec stratification par statut professionnel) soit dans le bras assisté par l'IA, soit dans le bras témoin. Chaque participant se voit attribuer 10 vignettes de néphrologie en français ou en anglais et peut les compléter sur plusieurs sessions. Une fois qu'une vignette est soumise, elle ne peut plus être revisitée (« pas de retour en arrière »). Le temps de complétion par vignette est automatiquement enregistré.

Bras témoin

Les participants visualisent chaque vignette et fournissent jusqu'à trois diagnostics (« Top-3 »), suivis d'une évaluation de confiance (0-10).

Bras assisté par l'IA

Les participants entrent d'abord un diagnostic Top-3 initial et une évaluation de confiance sans assistance de l'IA. Le système affiche ensuite les suggestions diagnostiques de GPT-5, après quoi les participants peuvent réviser leurs diagnostics une fois. La vignette est verrouillée après soumission.

L'étude collecte :

  • les diagnostics initiaux et finaux,
  • les évaluations de confiance avant et (le cas échéant) après les suggestions de l'IA,
  • les temps de complétion,
  • les variables démographiques des participants,
  • et les sorties diagnostiques propres au modèle d'IA.

Une complétion partielle est autorisée ; toutes les vignettes complétées contribuent à l'analyse.

Les critères de jugement principaux et secondaires incluent la précision diagnostique (Top-3 et Top-1), l'amélioration de la précision avant vs après l'IA, les changements de confiance diagnostique, les erreurs diagnostiques induites par l'IA, le benchmarking humain contre IA, les métriques d'efficacité du temps de complétion et la proportion de vignettes attribuées complétées.

L'analyse principale comparera la précision diagnostique entre le bras témoin (médecins seuls) et le bras expérimental (médecins assistés par le modèle d'IA). La précision est analysée comme un critère de jugement binaire (diagnostic correct vs incorrect). Étant donné que chaque participant évalue plusieurs vignettes cliniques, la précision sera modélisée à l'aide d'une régression logistique à effets mixtes avec un effet fixe pour le bras d'étude et des intercepts aléatoires à la fois pour le participant et la vignette. Cette approche tient compte du regroupement et de la difficulté variable entre les cas. Le test d'hypothèse principal utilise un α bilatéral = 0,05. Les tailles d'effet seront rapportées sous forme de rapports de cotes avec des intervalles de confiance à 95 %. Les analyses secondaires exploreront si la précision varie selon des facteurs démographiques (par exemple, niveau d'expérience, spécialité) à l'aide de termes d'interaction.

Étant donné que chaque participant évalue plusieurs vignettes, l'équipe a également effectué des analyses de puissance basées sur la simulation en utilisant des modèles de régression logistique à effets mixtes avec des intercepts aléatoires à la fois pour le participant et la vignette, en supposant un ICC intra-participant de 0,10. Sous ces hypothèses, un échantillon total de 100 participants (50 par bras) avec 10 vignettes par participant fournit une puissance >99 % pour détecter une amélioration cliniquement significative de la précision diagnostique. Les investigateurs prévoient donc d'inclure environ 100 participants au total.

Cette étude vise à quantifier si le raisonnement augmenté par l'IA améliore de manière significative les performances diagnostiques et la prise de décision lorsque les cliniciens évaluent des cas complexes de néphrologie.

Type d'étude

Interventionnel

Inscription (Estimé)

100

Phase

  • N'est pas applicable

Contacts et emplacements

Cette section fournit les coordonnées de ceux qui mènent l'étude et des informations sur le lieu où cette étude est menée.

Coordonnées de l'étude

Lieux d'étude

Critères de participation

Les chercheurs recherchent des personnes qui correspondent à une certaine description, appelée critères d'éligibilité. Certains exemples de ces critères sont l'état de santé général d'une personne ou des traitements antérieurs.

Critère d'éligibilité

Âges éligibles pour étudier

  • Adulte
  • Adulte plus âgé

Accepte les volontaires sains

Oui

La description

Critères d'inclusion :

Adultes âgés de 18 ans ou plus.

Capables de lire et de répondre à des vignettes cliniques en anglais ou en français.

Accès à un ordinateur ou à un smartphone avec une connexion Internet.

Fournissent un consentement éclairé en ligne.

Les participants doivent avoir au moins une formation médicale de base (par exemple, étudiants en médecine, résidents, fellows ou cliniciens en exercice), bien qu'aucune vérification formelle ne soit requise.

Critères d'exclusion :

Personnes de moins de 18 ans.

Incapacité à terminer les procédures d'étude en ligne.

Participation antérieure à la conception, au développement ou à l'évaluation du système d'IA utilisé dans cette étude.

Plan d'étude

Cette section fournit des détails sur le plan d'étude, y compris la façon dont l'étude est conçue et ce que l'étude mesure.

Comment l'étude est-elle conçue ?

Détails de conception

  • Objectif principal: Diagnostique
  • Répartition: Randomisé
  • Modèle interventionnel: Affectation parallèle
  • Masquage: Aucun (étiquette ouverte)

Armes et Interventions

Groupe de participants / Bras
Intervention / Traitement
Expérimental: Groupe avec suggestions d'IA
Les participants de ce bras d'étude compléteront les mêmes vignettes cliniques que le groupe témoin. Pour chaque cas, ils recevront un diagnostic suggéré généré par un grand modèle de langage (GPT-5, configuration haute-raisonnement), qui a été sélectionné après un benchmarking interne. Les participants peuvent examiner la suggestion d'IA avant de saisir leur propre réponse diagnostique finale. Aucune information supplémentaire, incitation ou coaching n'est fournie. L'intervention consiste uniquement à afficher la suggestion diagnostique générée par l'IA pendant la tâche de résolution de cas.
Cette intervention consiste à afficher une suggestion de diagnostic générée par l'IA pendant la tâche de résolution de cas clinique. Après avoir lu chaque vignette, les participants voient la proposition de diagnostic principale produite par un grand modèle de langage (GPT-5, configuration à raisonnement élevé), sélectionnée après un benchmarking interne. La suggestion d'IA apparaît une fois par vignette et ne peut pas être redemandée ou modifiée. Les participants peuvent réviser leur réponse diagnostique après avoir vu la suggestion, mais ils ne peuvent pas revenir à la vignette ultérieurement. Aucun conseil supplémentaire, coaching ou fonctionnalité interactive n'est fourni.
Aucune intervention: Groupe sans suggestions d'IA
Les participants de ce groupe réaliseront les vignettes cliniques de manière indépendante, sans aucune suggestion de diagnostic générée par IA. Ils liront chaque vignette et fourniront leur propre réponse diagnostique en se basant uniquement sur les informations présentées. Aucun support décisionnel externe ni matériel supplémentaire n'est fourni.

Que mesure l'étude ?

Principaux critères de jugement

Mesure des résultats
Description de la mesure
Délai
Précision diagnostique finale (top-3) avec vs sans assistance IA
Délai: Du premier scénario répondu jusqu'à la fin de l'étude (jusqu'à 12 mois).

Pour chaque participant, proportion de vignettes où le diagnostic principal correct est inclus dans le top-3 des diagnostics final du participant. Comparer la précision du top-3 final entre le bras IA (après suggestions d'IA) et le bras témoin (sans IA).

Pourcentage de cas correctement diagnostiqués (top-3).

Du premier scénario répondu jusqu'à la fin de l'étude (jusqu'à 12 mois).

Mesures de résultats secondaires

Mesure des résultats
Description de la mesure
Délai
Exactitude diagnostique finale (top-1) avec vs sans assistance IA
Délai: De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Pour chaque participant, proportion de vignettes où le diagnostic principal correct est inclus dans le top-1 des diagnostics finaux du participant. Comparer la précision finale du top-1 entre le bras IA (après suggestions de l'IA) et le bras témoin (sans IA). Pourcentage de cas correctement diagnostiqués (top-1).
De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Évolution de la précision diagnostique des trois principaux diagnostics avant et après les suggestions de l'IA (bras IA uniquement)
Délai: De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).

Dans le bras assisté par IA, les participants fournissent d'abord une réponse initiale (jusqu'à trois diagnostics) sans suggestions d'IA, puis voient des suggestions générées par IA et peuvent réviser leur réponse une fois ; ils ne peuvent pas revenir à cette vignette plus tard. Pour chaque participant, les investigateurs calculent la différence de précision top-3 entre les réponses initiales et finales sur toutes les vignettes complétées.

Changement en points de pourcentage de la précision diagnostique Top-3

De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Évolution de la précision diagnostique de premier rang avant vs après les suggestions d'IA (bras IA uniquement)
Délai: De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).

Dans le bras soutenu par l'IA, les participants fournissent d'abord une réponse initiale (jusqu'à trois diagnostics) sans suggestions d'IA, puis voient des suggestions générées par l'IA et peuvent réviser leur réponse une fois ; ils ne peuvent pas revenir à cette vignette plus tard. Pour chaque participant, les investigateurs calculent la différence de précision top-1 entre les réponses initiales et finales sur toutes les vignettes complétées.

Changement en points de pourcentage de la précision diagnostique Top-1

De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Confiance diagnostique (0-10) avant les suggestions IA : Bras témoin vs bras IA
Délai: De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).

Les participants dans les deux groupes évaluent leur confiance (échelle de 0 à 10) dans leur proposition de diagnostic parmi les 3 meilleures avant toute suggestion d'IA.

Dans le groupe IA, il s'agit de l'évaluation « pré-IA ». Dans le groupe témoin, il s'agit de l'unique évaluation de confiance (puisqu'aucune IA n'est affichée).

Les investigateurs comparent la confiance pré-IA entre les groupes, agrégée sur toutes les vignettes complétées par participant.

De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Confiance diagnostique finale (0-10) après suggestions d'IA : Groupe témoin vs groupe IA
Délai: De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).

Confiance diagnostique finale (échelle de 0 à 10) dans la proposition des 3 principaux diagnostics sur l'ensemble des vignettes terminées, comparée entre les groupes.

Dans le groupe IA, il s'agit de l'évaluation de confiance post-IA. Dans le groupe témoin, il s'agit de la même évaluation de confiance (les participants ne reçoivent pas de suggestions d'IA).

De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Changement de confiance diagnostique (0-10) avant vs après les suggestions d'IA (bras IA uniquement)
Délai: De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).

Dans le bras IA, les participants fournissent des évaluations de confiance (échelle de 0 à 10) pour leurs trois principaux diagnostics, à la fois avant et après avoir vu les suggestions de l'IA.

Pour chaque participant, les investigateurs calculent le changement intra-participant (post-IA moins pré-IA) sur toutes les vignettes complétées.

Changement du score de confiance (échelle de 0 à 10)

De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Erreur de diagnostic induite par l'IA (bras IA uniquement)
Délai: De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Parmi les vignettes complétées où le diagnostic Top-1 initial du participant est correct, proportion pour laquelle le diagnostic Top-1 final devient incorrect après les suggestions de l'IA.
De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Modification des 3 principaux diagnostics après les suggestions de l'IA (bras IA uniquement)
Délai: De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Parmi les vignettes complétées dans le bras IA, la proportion où le diagnostic Top-3 diffère entre les réponses pré-IA et post-IA.
De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Précision diagnostique top-3 : Toutes les réponses humaines avant l'IA vs précision de l'IA
Délai: Du premier vignette répondu jusqu'à la fin de l'étude (jusqu'à 12 mois).

Pour chaque vignette, la précision diagnostique Top-3 des participants humains avant toute suggestion d'IA (combinant les participants des deux bras de l'étude à leur étape pré-IA) est comparée à la précision diagnostique Top-3 du modèle d'IA pour la même vignette. Le Résultat rapporté est la différence de précision, définie comme la précision Top-3 de l'IA moins la précision Top-3 humaine pré-IA, exprimée en points de pourcentage et calculée au niveau de la vignette sur toutes les vignettes complétées.

Différence en points de pourcentage de la précision diagnostique Top-3

Du premier vignette répondu jusqu'à la fin de l'étude (jusqu'à 12 mois).
Précision diagnostique top-3 : Réponses finales humaines après IA vs précision de l'IA (bras IA uniquement)
Délai: Du premier vignette répondu jusqu'à la fin de l'étude (jusqu'à 12 mois).

Pour chaque vignette complétée dans le bras soutenu par l'IA, la précision diagnostique Top-3 des participants humains après avoir vu les suggestions de l'IA est comparée à la précision diagnostique Top-3 du modèle d'IA.

(La précision Top-3 est une mesure unique) Le Résultat rapporté est la différence de précision, définie comme la précision Top-3 de l'IA moins la précision Top-3 humaine post-IA, exprimée en points de pourcentage et calculée au niveau de la vignette pour toutes les vignettes complétées dans le bras IA.

Différence en points de pourcentage de la précision diagnostique Top-3 entre l'IA et l'humain

Du premier vignette répondu jusqu'à la fin de l'étude (jusqu'à 12 mois).
Temps de réalisation par vignette avec et sans assistance IA
Délai: De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).

Pour chaque vignette, la plateforme enregistre le temps entre l'ouverture de la vignette et la soumission de la réponse. Dans le bras témoin, un seul temps de complétion est enregistré pour chaque vignette. Dans le bras soutenu par l'IA, le temps de complétion est enregistré avant de consulter les suggestions de l'IA et à nouveau après avoir consulté les suggestions de l'IA. Le résultat rapporte la différence de temps de complétion entre les bras de l'étude, exprimée en secondes et calculée sur toutes les vignettes complétées.

Secondes (différence de temps de complétion)

De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Proportion des vignettes attribuées complétées
Délai: De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).
Pour chaque participant, la proportion des 10 vignettes complétées durant la période d'étude, comparée entre les bras.
De la première vignette répondue jusqu'à la fin de l'étude (jusqu'à 12 mois).

Collaborateurs et enquêteurs

C'est ici que vous trouverez les personnes et les organisations impliquées dans cette étude.

Dates d'enregistrement des études

Ces dates suivent la progression des dossiers d'étude et des soumissions de résultats sommaires à ClinicalTrials.gov. Les dossiers d'étude et les résultats rapportés sont examinés par la Bibliothèque nationale de médecine (NLM) pour s'assurer qu'ils répondent à des normes de contrôle de qualité spécifiques avant d'être publiés sur le site Web public.

Dates principales de l'étude

Début de l'étude (Réel)

20 novembre 2025

Achèvement primaire (Estimé)

31 octobre 2026

Achèvement de l'étude (Estimé)

31 décembre 2026

Dates d'inscription aux études

Première soumission

19 novembre 2025

Première soumission répondant aux critères de contrôle qualité

12 janvier 2026

Première publication (Réel)

20 janvier 2026

Mises à jour des dossiers d'étude

Dernière mise à jour publiée (Réel)

20 janvier 2026

Dernière mise à jour soumise répondant aux critères de contrôle qualité

12 janvier 2026

Dernière vérification

1 janvier 2026

Plus d'information

Termes liés à cette étude

Informations sur les médicaments et les dispositifs, documents d'étude

Étudie un produit pharmaceutique réglementé par la FDA américaine

Non

Étudie un produit d'appareil réglementé par la FDA américaine

Non

Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .

S'abonner