- ICH GCP
- Register voor klinische proeven in de VS.
- Klinische proef NCT07352475
Redeneerverrijking Met Feedback Van IA in NEfrologie Trial (REFINe)
Reasoning Enhancement With Feedback From a Generative AI in Nephrology (REFINe): Een gerandomiseerde evaluatie van generatieve AI-ondersteuning bij nefrologische diagnose
Het doel van deze klinische studie is te onderzoeken hoe kunstmatige intelligentie (AI) artsen kan helpen bij het stellen van diagnoses in de niergeneeskunde. De onderzoekers willen weten of een AI-hulpmiddel, een groot taalmodel (LLM) genaamd, artsen kan helpen vaker de juiste diagnose te kiezen en meer vertrouwen te hebben in hun antwoorden.
Voordat de studie begon, testte het onderzoeksteam verschillende AI-modellen en koos een van de beste presteerders, een GPT-5-klasse model dat is ingesteld op hoge redeneerinspanning.
De belangrijkste vragen die deze studie wil beantwoorden zijn:
- Stellen artsen vaker de juiste diagnose wanneer ze AI-suggesties kunnen zien?
- Verandert het zien van AI-suggesties hoe zeker artsen zich voelen over hun diagnose?
Onderzoekers zullen artsen die AI-suggesties ontvangen vergelijken met artsen die geen AI-suggesties ontvangen om te zien hoe de AI de nauwkeurigheid, het vertrouwen en de besluitvorming beïnvloedt.
Deelnemers zullen maximaal 10 online klinische casussen voltooien. Voor elke casus zullen ze:
- Een korte medische scenario lezen
- Maximaal drie mogelijke diagnoses voorstellen
(Indien in de AI-groep) De AI-suggesties beoordelen en beslissen of ze hun antwoord willen wijzigen
De studie zal ook kijken hoe lang deelnemers erover doen om elke casus te beantwoorden en hoe de prestaties van de AI zich verhouden tot de menselijke antwoorden.
Studie Overzicht
Toestand
Conditie
Interventie / Behandeling
Gedetailleerde beschrijving
Deze studie evalueert of het verstrekken van real-time diagnostische suggesties van een hoog-redeneermodel (GPT-5) aan clinici de diagnostische nauwkeurigheid, het vertrouwen en de efficiëntie verbetert bij het oplossen van nefrologische klinische vignetten. Voordat het model voor de proef werd geselecteerd, heeft het onderzoeksteam verschillende state-of-the-art modellen gebenchmarkt op een pilootset van nefrologische casussen, waaronder: GPT-5, GPT-5-mini, O3, GPT-4o, Llama-4 Maverick-17B, Gemini-2.5-Pro, Qwen-3 VL-235B Thinking, DeepSeek-V3.2-Exp, MedGEMMA-27B, Claude Sonnet-4.5 en Magistral-Medium-2509. GPT-5 (hoog-redeneren) vertoonde de hoogste diagnostische prestaties, stabiliteit en interpreteerbaarheid, en werd geselecteerd als het AI-systeem dat in de interventiegroep wordt gebruikt.
Deelnemers omvatten medische studenten, arts-assistenten, fellows en praktiserende artsen. Na het aanmaken van een account voltooien deelnemers een demografische vragenlijst (specialisme, jaren ervaring, praktijktype, leeftijdscategorie, AI-bekendheid) en moeten expliciet instemmen met het gebruik van deze gegevens voor onderzoeksdoeleinden voordat ze toegang krijgen tot de vignetten. Er worden geen direct identificeerbare gegevens verzameld.
Deelnemers worden gerandomiseerd (met stratificatie op professionele status) naar de AI-ondersteunde groep of de controlegroep. Elke deelnemer krijgt 10 nefrologische vignetten in het Frans of Engels toegewezen en mag deze over meerdere sessies voltooien. Zodra een vignet is ingediend, kan het niet meer worden bekeken ("geen terugkeer"). De voltooiingstijd per vignet wordt automatisch geregistreerd.
Controlegroep
Deelnemers bekijken elk vignet en geven maximaal drie diagnoses ("Top-3"), gevolgd door een vertrouwensscore (0-10).
AI-ondersteunde groep
Deelnemers geven eerst een initiële Top-3 diagnose en vertrouwensscore in zonder AI-assistentie. Het systeem toont vervolgens de diagnostische suggesties van GPT-5, waarna deelnemers hun diagnoses eenmaal mogen herzien. Het vignet wordt na indiening vergrendeld.
De studie verzamelt:
- initiële en finale diagnoses,
- vertrouwensscores voor en (indien van toepassing) na AI-suggesties,
- voltooiingstijden,
- demografische variabelen van deelnemers,
- en de eigen diagnostische uitvoer van het AI-model.
Gedeeltelijke voltooiing is toegestaan; alle voltooide vignetten dragen bij aan de analyse.
Primaire en secundaire uitkomsten omvatten diagnostische nauwkeurigheid (Top-3 en Top-1), nauwkeurigheidsverbetering voor versus na AI, veranderingen in diagnostisch vertrouwen, AI-geïnduceerde diagnostische fouten, mens-versus-AI benchmarking, efficiëntiemetrieken voor voltooiingstijd en het aandeel toegewezen vignetten dat is voltooid.
De primaire analyse vergelijkt de diagnostische nauwkeurigheid tussen de controlegroep (artsen alleen) en de experimentele groep (artsen ondersteund door het AI-model). Nauwkeurigheid wordt geanalyseerd als een binaire uitkomst (correcte versus incorrecte diagnose). Omdat elke deelnemer meerdere klinische vignetten beoordeelt, wordt nauwkeurigheid gemodelleerd met behulp van een mixed-effects logistische regressie met een vast effect voor studiegroep en random intercepts voor zowel deelnemer als vignet. Deze benadering houdt rekening met clustering en variërende moeilijkheidsgraden tussen casussen. De primaire hypothesetest gebruikt een tweezijdige α = 0,05. Effectgroottes worden gerapporteerd als odds ratio's met 95% betrouwbaarheidsintervallen. Secundaire analyses onderzoeken of nauwkeurigheid varieert op basis van demografische factoren (bijv. ervaringsniveau, specialisme) met behulp van interactietermen.
Omdat elke deelnemer meerdere vignetten beoordeelt, heeft het team ook op simulatie gebaseerde poweranalyses uitgevoerd met behulp van mixed-effects logistische regressiemodellen met random intercepts voor zowel deelnemer als vignet, uitgaande van een intra-deelnemer ICC van 0,10. Onder deze aannames biedt een totale steekproef van 100 deelnemers (50 per groep) met 10 vignetten per deelnemer >99% power om een klinisch betekenisvolle verbetering in diagnostische nauwkeurigheid te detecteren. De onderzoekers zijn daarom van plan om in totaal ongeveer 100 deelnemers te includeren.
Deze studie heeft tot doel te kwantificeren of AI-augmented reasoning de diagnostische prestaties en besluitvorming van clinici betekenisvol verbetert bij het evalueren van complexe nefrologische casussen.
Studietype
Inschrijving (Geschat)
Fase
- Niet toepasbaar
Contacten en locaties
Studiecontact
- Naam: Raphaël BENTEGEAC, MD, MPH
- Telefoonnummer: +33651204000
- E-mail: raphael.bentegeac@univ-lille.fr
Studie Locaties
-
-
-
Lille, Frankrijk, 59000
- Werving
- Lille University Hospital (online study)
-
Contact:
- Raphaël BENTEGEAC, MD, MPH
- Telefoonnummer: +33651204000
- E-mail: raphael.bentegeac@chu-lille.fr
-
Contact:
- Aghiles HAMROUN, MD, PhD
- E-mail: aghiles.hamroun@univ-lille.fr
-
-
Deelname Criteria
Geschiktheidscriteria
Leeftijden die in aanmerking komen voor studie
- Volwassen
- Oudere volwassene
Accepteert gezonde vrijwilligers
Beschrijving
Inclusiecriteria:
Volwassenen van 18 jaar of ouder.
In staat zijn om klinische vignetten in het Engels of Frans te lezen en te beantwoorden.
Toegang tot een computer of smartphone met een internetverbinding.
Online geïnformeerde toestemming geven.
Van de deelnemers wordt verwacht dat zij ten minste een basis medische opleiding hebben (bijv. geneeskundestudenten, arts-assistenten, fellows of praktiserende clinici), hoewel geen formele verificatie vereist is.
Exclusiecriteria:
Personen jonger dan 18 jaar.
Onvermogen om de online studieprocedures te voltooien.
Eerdere betrokkenheid bij het ontwerp, de ontwikkeling of de evaluatie van het AI-systeem dat in deze studie wordt gebruikt.
Studie plan
Hoe is de studie opgezet?
Ontwerpdetails
- Primair doel: Diagnostisch
- Toewijzing: Gerandomiseerd
- Interventioneel model: Parallelle opdracht
- Masker: Geen (open label)
Wapens en interventies
Deelnemersgroep / Arm |
Interventie / Behandeling |
|---|---|
|
Experimenteel: Groep met AI-suggesties
Deelnemers in deze arm zullen dezelfde klinische casusvignetten voltooien als de controlegroep.
Voor elke casus ontvangen zij een voorgestelde diagnose gegenereerd door een groot taalmodel (GPT-5, configuratie voor hoog redeneervermogen), die na interne benchmarking werd geselecteerd.
Deelnemers kunnen de AI-suggestie bekijken voordat zij hun eigen definitieve diagnostische antwoord invoeren.
Er wordt geen aanvullende informatie, aanwijzingen of coaching verstrekt.
De interventie bestaat uitsluitend uit het tonen van de door AI gegenereerde diagnostische suggestie tijdens de casusoplossingstaak.
|
Deze interventie bestaat uit het tonen van een door AI gegenereerde diagnostische suggestie tijdens de klinische casusoplossingstaak.
Na het lezen van elke vignet zien de deelnemers het beste diagnostische voorstel dat is geproduceerd door een groot taalmodel (GPT-5, hoog-redeneerconfiguratie), geselecteerd na interne benchmarking.
De AI-suggestie verschijnt één keer per vignet en kan niet opnieuw worden opgevraagd of aangepast.
Deelnemers kunnen hun diagnostische antwoord herzien na het bekijken van de suggestie, maar ze kunnen later niet meer terugkeren naar de vignet.
Er worden geen aanvullende richtlijnen, coaching of interactieve functies geboden.
|
|
Geen tussenkomst: Groep zonder AI-suggesties
Deelnemers in deze groep zullen de klinische casusvignetten zelfstandig voltooien, zonder enige door AI gegenereerde diagnostische suggesties.
Ze zullen elke vignette lezen en hun eigen diagnostische antwoord geven, uitsluitend gebaseerd op de gepresenteerde informatie.
Er wordt geen externe beslissingsondersteuning of aanvullende materialen verstrekt.
|
Wat meet het onderzoek?
Primaire uitkomstmaten
Uitkomstmaat |
Maatregel Beschrijving |
Tijdsspanne |
|---|---|---|
|
Einddiagnostische nauwkeurigheid (top-3) met vs zonder AI-ondersteuning
Tijdsspanne: Vanaf de eerste beantwoorde vignette tot het einde van de studie (maximaal 12 maanden).
|
Voor elke deelnemer, het aandeel vignetten waarin de juiste hoofddiagnose is opgenomen in de top-3 diagnoses van de deelnemer. Vergelijk de nauwkeurigheid van de uiteindelijke top-3 tussen de AI-arm (na AI-suggesties) en de controle-arm (zonder AI). Percentage correct gediagnosticeerde gevallen (top-3). |
Vanaf de eerste beantwoorde vignette tot het einde van de studie (maximaal 12 maanden).
|
Secundaire uitkomstmaten
Uitkomstmaat |
Maatregel Beschrijving |
Tijdsspanne |
|---|---|---|
|
Definitieve diagnostische nauwkeurigheid (top-1) met versus zonder AI-ondersteuning
Tijdsspanne: Van de eerste beantwoorde vignette tot het einde van de studie (tot 12 maanden).
|
Voor elke deelnemer, de verhouding van vignetten waarin de juiste hoofddiagnose is opgenomen in de top-1-diagnoses van de deelnemer.
Vergelijk de uiteindelijke top-1-nauwkeurigheid tussen de AI-arm (na AI-suggesties) en de controlearm (zonder AI).
Percentage van correct gediagnosticeerde gevallen (top-1).
|
Van de eerste beantwoorde vignette tot het einde van de studie (tot 12 maanden).
|
|
Verandering in top-3 diagnostische nauwkeurigheid voor versus na AI-suggesties (alleen AI-arm)
Tijdsspanne: Van de eerste beantwoorde vignet tot het einde van de studie (tot 12 maanden).
|
In de door AI ondersteunde arm geven deelnemers eerst een initieel antwoord (maximaal drie diagnoses) zonder AI-suggesties, zien vervolgens door AI gegenereerde suggesties en mogen hun antwoord één keer herzien; ze kunnen later niet meer terugkeren naar die vignet. Procentpuntverandering in Top-3 diagnostische nauwkeurigheid |
Van de eerste beantwoorde vignet tot het einde van de studie (tot 12 maanden).
|
|
Verandering in top-1 diagnostische nauwkeurigheid vóór versus na AI-suggesties (alleen AI-arm)
Tijdsspanne: Vanaf de eerste beantwoorde vignet tot het einde van de studie (maximaal 12 maanden).
|
In de door AI ondersteunde arm geven deelnemers eerst een eerste antwoord (maximaal drie diagnoses) zonder AI-suggesties, zien vervolgens AI-gegenereerde suggesties en kunnen hun antwoord één keer herzien; ze kunnen later niet meer terugkeren naar die vignet. Procentpuntverandering in Top-1 diagnostische nauwkeurigheid |
Vanaf de eerste beantwoorde vignet tot het einde van de studie (maximaal 12 maanden).
|
|
Diagnostische zekerheid (0-10) vóór AI-suggesties: Controlegroep versus AI-groep
Tijdsspanne: Vanaf de eerste beantwoorde vignet tot het einde van de studie (maximaal 12 maanden).
|
Deelnemers in beide groepen beoordelen hun vertrouwen (schaal van 0-10) in hun Top-3 diagnostische voorstel voordat er AI-suggesties worden gegeven. In de AI-groep is dit de "pre-AI"-beoordeling. In de controlegroep is dit de enige vertrouwensbeoordeling (aangezien er geen AI wordt getoond). De onderzoekers vergelijken het pre-AI-vertrouwen tussen de groepen, geaggregeerd over alle voltooide vignetten per deelnemer. |
Vanaf de eerste beantwoorde vignet tot het einde van de studie (maximaal 12 maanden).
|
|
Einddiagnostische zekerheid (0-10) na AI-suggesties: Controle- versus AI-arm
Tijdsspanne: Vanaf de eerste beantwoorde vignette tot het einde van de studie (tot 12 maanden).
|
Laatste diagnostische zekerheid (schaal van 0-10) in de Top-3 diagnostische voorstellen over alle voltooide vignetten, vergeleken tussen de groepen. In de AI-groep is dit de vertrouwensscore na AI. In de Controlegroep is dit dezelfde vertrouwensscore (deelnemers krijgen geen AI-suggesties). |
Vanaf de eerste beantwoorde vignette tot het einde van de studie (tot 12 maanden).
|
|
Verandering in diagnostische zekerheid (0-10) vóór versus na AI-suggesties (alleen AI-arm)
Tijdsspanne: Vanaf de eerste beantwoorde vignet tot het einde van de studie (maximaal 12 maanden).
|
In de AI-groep geven deelnemers vertrouwensscores (schaal van 0-10) voor hun top-3 diagnoses, zowel vóór als na het zien van AI-suggesties. Voor elke deelnemer berekenen de onderzoekers de binnen-deelnemer verandering (na-AI minus vóór-AI) over alle voltooide vignetten. Verandering in vertrouwensscore (schaal van 0-10) |
Vanaf de eerste beantwoorde vignet tot het einde van de studie (maximaal 12 maanden).
|
|
AI-geïnduceerde diagnostische fout (alleen AI-arm)
Tijdsspanne: Vanaf de eerste beantwoorde vignette tot het einde van de studie (maximaal 12 maanden).
|
Onder voltooide vignetten waarbij de initiële Top-1-diagnose van de deelnemer correct is, het aandeel waarvoor de uiteindelijke Top-1-diagnose onjuist wordt na AI-suggesties.
|
Vanaf de eerste beantwoorde vignette tot het einde van de studie (maximaal 12 maanden).
|
|
Verandering in top-3 diagnose na AI-suggesties (alleen AI-arm)
Tijdsspanne: Vanaf de eerste beantwoorde vignette tot het einde van de studie (maximaal 12 maanden).
|
Onder de voltooide vignetten in de AI-arm, het aandeel waarbij de Top-3 diagnose verschilt tussen pre-AI en post-AI antwoorden.
|
Vanaf de eerste beantwoorde vignette tot het einde van de studie (maximaal 12 maanden).
|
|
Top-3 diagnostische nauwkeurigheid: Alle menselijke antwoorden vóór AI vs AI-nauwkeurigheid
Tijdsspanne: Van het eerste beantwoorde vignet tot het einde van de studie (tot 12 maanden).
|
Voor elke vignette wordt de Top-3 diagnostische nauwkeurigheid van menselijke deelnemers vóór enige AI-suggesties (gecombineerd van deelnemers uit beide studiegroepen in hun pre-AI-fase) vergeleken met de Top-3 diagnostische nauwkeurigheid van het AI-model voor hetzelfde vignette. De gerapporteerde uitkomst is het nauwkeurigheidsverschil, gedefinieerd als AI Top-3 nauwkeurigheid minus menselijke pre-AI Top-3 nauwkeurigheid, uitgedrukt in procentpunten en berekend op vignetteniveau over alle voltooide vignettes. Procentpuntverschil in Top-3 diagnostische nauwkeurigheid |
Van het eerste beantwoorde vignet tot het einde van de studie (tot 12 maanden).
|
|
Top-3 diagnostische nauwkeurigheid: Menselijke eindantwoorden na AI vs AI-nauwkeurigheid (alleen AI-arm)
Tijdsspanne: Vanaf de eerste beantwoorde vignette tot het einde van de studie (maximaal 12 maanden).
|
Voor elk voltooid vignet in de AI-ondersteunde arm wordt de Top-3 diagnostische nauwkeurigheid van menselijke deelnemers na het bekijken van AI-suggesties vergeleken met de Top-3 diagnostische nauwkeurigheid van het AI-model. (Top-3 nauwkeurigheid is een enkele maatstaf) De gerapporteerde uitkomst is het nauwkeurigheidsverschil, gedefinieerd als AI Top-3 nauwkeurigheid minus menselijke post-AI Top-3 nauwkeurigheid, uitgedrukt in procentpunten en berekend op vignetniveau voor alle voltooide vignetten in de AI-arm. Procentpuntverschil in Top-3 diagnostische nauwkeurigheid tussen AI en mens |
Vanaf de eerste beantwoorde vignette tot het einde van de studie (maximaal 12 maanden).
|
|
Voltooiingstijd per vignette met en zonder AI-ondersteuning
Tijdsspanne: Vanaf de eerste beantwoorde vignet tot het einde van de studie (maximaal 12 maanden).
|
Voor elke vignet registreert het platform de tijd vanaf het openen van de vignet tot het indienen van het antwoord. In de controlegroep wordt voor elke vignet één afrondingstijd geregistreerd. In de AI-ondersteunde groep wordt de afrondingstijd geregistreerd vóór het bekijken van AI-suggesties en opnieuw na het bekijken van AI-suggesties. De uitkomst rapporteert het verschil in afrondingstijd tussen de onderzoeksgroepen, uitgedrukt in seconden en berekend over alle voltooide vignetten. Seconden (verschil in afrondingstijd) |
Vanaf de eerste beantwoorde vignet tot het einde van de studie (maximaal 12 maanden).
|
|
Aandeel toegewezen vignetten voltooid
Tijdsspanne: Vanaf de eerste beantwoorde vignette tot het einde van de studie (tot 12 maanden).
|
Voor elke deelnemer, de verhouding van de 10 vignetten die binnen de onderzoeksperiode zijn voltooid, vergeleken tussen de armen.
|
Vanaf de eerste beantwoorde vignette tot het einde van de studie (tot 12 maanden).
|
Medewerkers en onderzoekers
Sponsor
Studie record data
Bestudeer belangrijke data
Studie start (Werkelijk)
Primaire voltooiing (Geschat)
Studie voltooiing (Geschat)
Studieregistratiedata
Eerst ingediend
Eerst ingediend dat voldeed aan de QC-criteria
Eerst geplaatst (Werkelijk)
Updates van studierecords
Laatste update geplaatst (Werkelijk)
Laatste update ingediend die voldeed aan QC-criteria
Laatst geverifieerd
Meer informatie
Termen gerelateerd aan deze studie
Trefwoorden
Aanvullende relevante MeSH-voorwaarden
Andere studie-ID-nummers
- CHUL-191125
Informatie over medicijnen en apparaten, studiedocumenten
Bestudeert een door de Amerikaanse FDA gereguleerd geneesmiddel
Bestudeert een door de Amerikaanse FDA gereguleerd apparaatproduct
Deze informatie is zonder wijzigingen rechtstreeks van de website clinicaltrials.gov gehaald. Als u verzoeken heeft om uw onderzoeksgegevens te wijzigen, te verwijderen of bij te werken, neem dan contact op met register@clinicaltrials.gov. Zodra er een wijziging wordt doorgevoerd op clinicaltrials.gov, wordt deze ook automatisch bijgewerkt op onze website .