- ICH GCP
- US Clinical Trials Registry
- Klinisk utprøving NCT07352475
Begrunnelsesberikelse med tilbakemelding fra IA i NEfrologi-prøve (REFINe)
Forbedring av resonnering med tilbakemelding fra generativ kunstig intelligens i nefrologi (REFINe): En randomisert evaluering av generativ KI-støtte i nefrologisk diagnostikk
Målet med denne kliniske studien er å lære hvordan kunstig intelligens (AI) kan hjelpe leger med å stille diagnoser innen nyremedisin. Forskerne ønsker å finne ut om et AI-verktøy kalt en stor språkmodell (LLM) kan hjelpe leger til å velge riktig diagnose oftere og føle seg mer sikre på svarene sine.
Før studien startet, testet forskerteamet flere AI-modeller og valgte en av de beste, en GPT-5-klassemodell satt til å bruke høyt resonneringsnivå.
Hovedspørsmålene denne studien tar sikte på å besvare er:
- Stiller leger flere riktige diagnoser når de kan se AI-forslag?
- Endrer det seg hvor sikre leger føler seg på diagnosen sin når de ser AI-forslag?
Forskere vil sammenligne leger som mottar AI-forslag med leger som ikke mottar AI-forslag for å se hvordan AI påvirker nøyaktighet, selvtillit og beslutningstaking.
Deltakere vil fullføre opptil 10 online kliniske caser. For hver case vil de:
- Lese et kort medisinsk scenario
- Foreslå opptil tre mulige diagnoser
(Hvis i AI-gruppen) Gå gjennom AI-ens forslag og avgjøre om de skal endre svaret sitt
Studien vil også se på hvor lang tid deltakerne bruker på å besvare hver case og hvordan AI-ens ytelse sammenlignes med de menneskelige svarene.
Studieoversikt
Status
Forhold
Intervensjon / Behandling
Detaljert beskrivelse
Denne studien evaluerer om det å gi klinikere sanntids diagnostiske forslag fra en stor språkmodell med høy resonneringsevne (GPT-5) forbedrer diagnostisk nøyaktighet, selvtillit og effektivitet når de løser nefrologiske kliniske vignetter. Før modellen ble valgt for forsøket, benchmarket forskningsteamet flere toppmoderne modeller på et pilotsett av nefrologitilfeller, inkludert: GPT-5, GPT-5-mini, O3, GPT-4o, Llama-4 Maverick-17B, Gemini-2.5-Pro, Qwen-3 VL-235B Thinking, DeepSeek-V3.2-Exp, MedGEMMA-27B, Claude Sonnet-4.5, og Magistral-Medium-2509. GPT-5 (høy resonneringsevne) viste den høyeste diagnostiske ytelsen, stabiliteten og tolkbarheten, og ble valgt som KI-systemet som brukes i intervensjonsgruppen.
Deltakere inkluderer medisinstudenter, turnuskandidater, stipendiater og praktiserende leger. Etter å ha opprettet en konto, fullfører deltakerne et demografisk spørreskjema (spesialitet, års erfaring, praksistype, alderskategori, KI-kjennskap) og må eksplisitt godta bruken av disse dataene til forskningsformål før de får tilgang til vignettene. Ingen direkte identifiserende informasjon samles inn.
Deltakerne randomiseres (med stratifisering etter profesjonell status) til enten KI-støttet gruppe eller kontrollgruppen. Hver deltaker tildeles 10 nefrologiske vignetter på fransk eller engelsk og kan fullføre dem over flere økter. Når en vignett er innsendt, kan den ikke revideres ("ingen tilbakesporing"). Fullføringstid per vignett registreres automatisk.
Kontrollgruppe
Deltakerne ser hver vignett og oppgir opptil tre diagnoser ("Top-3"), etterfulgt av en selvtillitsvurdering (0-10).
KI-Støttet Gruppe
Deltakerne oppgir først en innledende Top-3 diagnose og selvtillitsvurdering uten KI-assistanse. Systemet viser deretter GPT-5s diagnostiske forslag, hvoretter deltakerne kan revidere sine diagnoser én gang. Vignetten låses etter innsending.
Studien samler inn:
- innledende og endelige diagnoser,
- selvtillitsvurderinger før og (hvis aktuelt) etter KI-forslag,
- fullføringstider,
- deltakernes demografiske variabler,
- og KI-modellens egne diagnostiske utdata.
Delvis fullføring er tillatt; alle fullførte vignetter bidrar til analysen.
Primære og sekundære utfall inkluderer diagnostisk nøyaktighet (Top-3 og Top-1), nøyaktighetsforbedring før vs. etter KI, endringer i diagnostisk selvtillit, KI-induserte diagnostiske feil, menneske-versus-KI benchmarking, effektivitetsmål for fullføringstid, og andelen av tildelte vignetter som fullføres.
Den primære analysen vil sammenligne diagnostisk nøyaktighet mellom kontrollgruppen (leger alene) og eksperimentgruppen (leger assistert av KI-modellen). Nøyaktighet analyseres som et binært utfall (riktig vs feil diagnose). Siden hver deltaker evaluerer flere kliniske vignetter, vil nøyaktighet modelleres ved bruk av en logistisk regresjon med blandede effekter med en fast effekt for studiegruppe og tilfeldige skjæringspunkter for både deltaker og vignett. Denne tilnærmingen tar hensyn til klyngeeffekt og varierende vanskelighetsgrad på tvers av tilfeller. Den primære hypotesetesten bruker en tosidig α = 0,05. Effektstørrelser rapporteres som oddsforhold med 95 % konfidensintervaller. Sekundære analyser vil undersøke om nøyaktighet varierer med demografiske faktorer (f.eks. erfaring, spesialitet) ved bruk av interaksjonsledd.
Siden hver deltaker evaluerer flere vignetter, utførte teamet også simuleringsbaserte styrkeanalyser ved bruk av logistiske regresjonsmodeller med blandede effekter med tilfeldige skjæringspunkter for både deltaker og vignett, med antatt intra-deltaker ICC på 0,10. Under disse forutsetningene gir et totalt utvalg på 100 deltakere (50 per gruppe) med 10 vignetter per deltaker >99 % styrke til å oppdage en klinisk meningsfull forbedring i diagnostisk nøyaktighet. Forskerne planlegger derfor å rekruttere omtrent 100 deltakere totalt.
Denne studien har som mål å kvantifisere om KI-forsterket resonnering meningsfullt forbedrer diagnostisk ytelse og beslutningstaking når klinikere evaluerer komplekse nefrologitilfeller.
Studietype
Registrering (Antatt)
Fase
- Ikke aktuelt
Kontakter og plasseringer
Studiekontakt
- Navn: Raphaël BENTEGEAC, MD, MPH
- Telefonnummer: +33651204000
- E-post: raphael.bentegeac@univ-lille.fr
Studiesteder
-
-
-
Lille, Frankrike, 59000
- Rekruttering
- Lille University Hospital (online study)
-
Ta kontakt med:
- Raphaël BENTEGEAC, MD, MPH
- Telefonnummer: +33651204000
- E-post: raphael.bentegeac@chu-lille.fr
-
Ta kontakt med:
- Aghiles HAMROUN, MD, PhD
- E-post: aghiles.hamroun@univ-lille.fr
-
-
Deltakelseskriterier
Kvalifikasjonskriterier
Alder som er kvalifisert for studier
- Voksen
- Eldre voksen
Tar imot friske frivillige
Beskrivelse
Inklusjonskriterier:
Voksne i alderen 18 år eller eldre.
I stand til å lese og svare på kliniske vignetter på engelsk eller fransk.
Tilgang til en datamaskin eller smarttelefon med internettilkobling.
Gir samtykke på nett.
Deltakerne forventes å ha minst grunnleggende medisinsk opplæring (f.eks. medisinstudenter, turnuskandidater, stipendiater eller praktiserende klinikere), selv om ingen formell verifisering kreves.
Eksklusjonskriterier:
Personer under 18 år.
Manglende evne til å fullføre nettbaserte studiefremgangsmåter.
Tidligere involvering i utforming, utvikling eller evaluering av AI-systemet som brukes i denne studien.
Studieplan
Hvordan er studiet utformet?
Designdetaljer
- Primært formål: Diagnostisk
- Tildeling: Randomisert
- Intervensjonsmodell: Parallell tildeling
- Masking: Ingen (Open Label)
Våpen og intervensjoner
Deltakergruppe / Arm |
Intervensjon / Behandling |
|---|---|
|
Eksperimentell: Gruppe med AI-forslag
Deltakerne i denne armen vil fullføre de samme kliniske kasusvignettene som kontrollgruppen.
For hvert tilfelle vil de motta en foreslått diagnose generert av en stor språkmodell (GPT-5, høyt resonneringskonfigurasjon), som ble valgt etter intern benchmarking.
Deltakerne kan gjennomgå AI-forslaget før de legger inn sitt eget endelige diagnostiske svar.
Ingen ytterligere informasjon, spørsmål eller veiledning gis.
Intervensjonen består utelukkende av å vise det AI-genererte diagnostiske forslaget under kasusløsningsoppgaven.
|
Denne intervensjonen består i å vise et AI-generert diagnostisk forslag under den kliniske case-løsningsøvelsen.
Etter å ha lest hver vignett ser deltakerne det øverste diagnostiske forslaget produsert av en stor språkmodell (GPT-5, høy resonneringskonfigurasjon), valgt etter intern benchmarking.
AI-forslaget vises én gang per vignett og kan ikke forespørres på nytt eller endres.
Deltakerne kan revidere sitt diagnostiske svar etter å ha sett forslaget, men de kan ikke gå tilbake til vignetten senere.
Ingen ytterligere veiledning, coaching eller interaktive funksjoner tilbys.
|
|
Ingen inngripen: Gruppe uten KI-forslag
Deltakerne i denne armen vil fullføre de kliniske kasusvignettene uavhengig, uten noen AI-genererte diagnostiske forslag.
De vil lese hver vignett og gi sitt eget diagnostiske svar utelukkende basert på informasjonen som presenteres.
Ingen ekstern beslutningsstøtte eller tilleggsmateriell tilbys.
|
Hva måler studien?
Primære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
Endelig diagnostisk nøyaktighet (topp-3) med vs uten KI-støtte
Tidsramme: Fra første vignett besvart til studiens slutt (opptil 12 måneder).
|
For hver deltaker, andelen av vignetter der riktig hoveddiagnose er inkludert i deltakerens endelige topp-3 diagnoser. Sammenlign nøyaktigheten av endelig topp-3 mellom AI-gruppen (etter AI-forslag) og kontrollgruppen (uten AI). Prosentandel av riktig diagnostiserte tilfeller (topp-3). |
Fra første vignett besvart til studiens slutt (opptil 12 måneder).
|
Sekundære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
Endelig diagnostisk nøyaktighet (topp-1) med vs uten AI-støtte
Tidsramme: Fra første vingettsvar til studiens slutt (opptil 12 måneder).
|
For hver deltaker, andel av vigner hvor den korrekte hoveddiagnosen er inkludert i deltakerens endelige topp-1-diagnoser.
Sammenlign endelig topp-1-nøyaktighet mellom AI-gruppen (etter AI-forslag) og kontrollgruppen (uten AI).
Prosentandel av korrekt diagnostiserte tilfeller (topp-1).
|
Fra første vingettsvar til studiens slutt (opptil 12 måneder).
|
|
Endring i topp-3 diagnostisk nøyaktighet før vs etter AI-forslag (kun AI-gruppen)
Tidsramme: Fra første vinjett besvart til slutten av studien (opptil 12 måneder).
|
I den AI-støttede gruppen gir deltakerne først et første svar (opptil tre diagnoser) uten AI-forslag, deretter ser de AI-genererte forslag og kan revidere svaret én gang; de kan ikke gå tilbake til den vignetten senere. For hver deltaker beregner forskerne forskjellen i topp-3-nøyaktighet mellom første og endelige svar over alle fullførte vignetter. Prosentpoeng endring i topp-3 diagnostisk nøyaktighet |
Fra første vinjett besvart til slutten av studien (opptil 12 måneder).
|
|
Endring i topp-1 diagnostisk nøyaktighet før vs etter AI-forslag (kun AI-gruppen)
Tidsramme: Fra første vingett besvart til studiens slutt (opptil 12 måneder).
|
I den KI-støttede gruppen gir deltakerne først et første svar (opptil tre diagnoser) uten KI-forslag, deretter ser de KI-genererte forslag og kan revidere svaret én gang; de kan ikke gå tilbake til den vignetten senere. For hver deltaker beregner forskerne forskjellen i topp-1 nøyaktighet mellom første og endelige svar på tvers av alle fullførte vignetter. Prosentpoengendring i topp-1 diagnostisk nøyaktighet |
Fra første vingett besvart til studiens slutt (opptil 12 måneder).
|
|
Diagnostisk tillit (0-10) før AI-forslag: Kontrollgruppe vs AI-gruppe
Tidsramme: Fra første vinjett besvart til studiens slutt (opptil 12 måneder).
|
Deltakere i begge grupper vurderer sin tillit (0–10-skala) til sine tre beste diagnostiske forslag før noen AI-forslag. I AI-gruppen er dette «pre-AI»-vurderingen. I kontrollgruppen er dette den eneste tillitsvurderingen (siden ingen AI vises). Forskerne sammenligner tilliten før AI mellom gruppene, aggregert over alle fullførte vinjetter per deltaker. |
Fra første vinjett besvart til studiens slutt (opptil 12 måneder).
|
|
Endelig diagnostisk tillit (0-10) etter AI-forslag: Kontrollgruppe vs AI-gruppe
Tidsramme: Fra første vignett besvart til studiens slutt (opptil 12 måneder).
|
Endelig diagnostisk tillit (0-10-skala) i Top-3 diagnostiske forslag over alle fullførte vignetter, sammenlignet mellom armene. I AI-armen er dette tillitsvurderingen etter AI. I Kontroll-armen er dette den samme tillitsvurderingen (deltakere mottar ikke AI-forslag). |
Fra første vignett besvart til studiens slutt (opptil 12 måneder).
|
|
Endring i diagnostisk tillit (0-10) før vs etter AI-forslag (kun AI-arm)
Tidsramme: Fra første vingett besvart til studiens slutt (opptil 12 måneder).
|
I AI-gruppen gir deltakerne selvtillitsvurderinger (skala 0-10) for sine Top-3-diagnoser både før og etter å ha sett AI-forslag. For hver deltaker beregner forskerne den individuelle endringen (etter AI minus før AI) på tvers av alle fullførte vignerter. Endring i selvtillitspoeng (skala 0-10) |
Fra første vingett besvart til studiens slutt (opptil 12 måneder).
|
|
AI-indusert diagnostisk feil (kun AI-arm)
Tidsramme: Fra første vingett besvart til studiens slutt (opptil 12 måneder).
|
Blant fullførte vignetter hvor deltakerens opprinnelige Top-1-diagnose er korrekt, andel hvor den endelige Top-1-diagnosen blir feil etter KI-forslag.
|
Fra første vingett besvart til studiens slutt (opptil 12 måneder).
|
|
Endring i Top-3-diagnoser etter AI-forslag (kun AI-gruppen)
Tidsramme: Fra første vingett besvart til slutten av studien (opptil 12 måneder).
|
Blant fullførte vignetter i AI-gruppen, andelen der de tre øverste diagnosene avviker mellom svar før AI og etter AI.
|
Fra første vingett besvart til slutten av studien (opptil 12 måneder).
|
|
Topp-3 diagnostisk nøyaktighet: Alle menneskelige svar før KI vs KI-nøyaktighet
Tidsramme: Fra første vingettscenario besvart til studiens slutt (opptil 12 måneder).
|
For hver vignett sammenlignes Top-3 diagnostisk nøyaktighet av menneskelige deltakere før noen AI-forslag (som kombinerer deltakere fra begge studiearmene på deres pre-AI-stadium) med Top-3 diagnostisk nøyaktighet av AI-modellen for samme vignett. Den rapporterte resultatet er nøyaktighetsforskjellen, definert som AI Top-3 nøyaktighet minus menneskelig pre-AI Top-3 nøyaktighet, uttrykt i prosentpoeng og beregnet på vignettnivå over alle fullførte vignetter. Prosentpoengforskjell i Top-3 diagnostisk nøyaktighet |
Fra første vingettscenario besvart til studiens slutt (opptil 12 måneder).
|
|
Topp-3 diagnostisk nøyaktighet: Menneskelige endelige svar etter KI vs KI-nøyaktighet (kun KI-arm)
Tidsramme: Fra første vingett besvart til studiens slutt (opptil 12 måneder).
|
For hvert vignett som er fullført i den KI-støttede gruppen, sammenlignes topp-3 diagnostisk nøyaktighet hos menneskelige deltakere etter å ha sett KI-forslag med topp-3 diagnostisk nøyaktighet hos KI-modellen. (Topp-3 nøyaktighet er en enkelt måling) Den rapporterte resultatvariabelen er nøyaktighetsforskjellen, definert som KI topp-3 nøyaktighet minus menneskelig topp-3 nøyaktighet etter KI, uttrykt i prosentpoeng og beregnet på vignettnivå for alle fullførte vignetter i KI-gruppen. Prosentpoengforskjell i topp-3 diagnostisk nøyaktighet mellom KI og menneske |
Fra første vingett besvart til studiens slutt (opptil 12 måneder).
|
|
Fullføringstid per vignett med og uten AI-støtte
Tidsramme: Fra første vigne-besvart til studiens slutt (opptil 12 måneder).
|
For hver vignett registrerer plattformen tiden fra vignettåpning til innsending av svar. I kontrollarmen registreres en enkelt fullføringstid for hver vignett. I den KI-støttede armen registreres fullføringstid før visning av KI-forslag og igjen etter visning av KI-forslag. Resultatet rapporterer forskjellen i fullføringstid mellom studiearmene, uttrykt i sekunder og beregnet over alle fullførte vignetter. Sekunder (forskjell i fullføringstid) |
Fra første vigne-besvart til studiens slutt (opptil 12 måneder).
|
|
Andel av tildelte vignetter fullført
Tidsramme: Fra første vinjett besvart til studiens slutt (opptil 12 måneder).
|
For hver deltaker, andelen av de 10 vinjettene som ble fullført innenfor studieperioden, sammenlignet mellom armene.
|
Fra første vinjett besvart til studiens slutt (opptil 12 måneder).
|
Samarbeidspartnere og etterforskere
Sponsor
Studierekorddatoer
Studer hoveddatoer
Studiestart (Faktiske)
Primær fullføring (Antatt)
Studiet fullført (Antatt)
Datoer for studieregistrering
Først innsendt
Først innsendt som oppfylte QC-kriteriene
Først lagt ut (Faktiske)
Oppdateringer av studieposter
Sist oppdatering lagt ut (Faktiske)
Siste oppdatering sendt inn som oppfylte QC-kriteriene
Sist bekreftet
Mer informasjon
Begreper knyttet til denne studien
Nøkkelord
Ytterligere relevante MeSH-vilkår
Andre studie-ID-numre
- CHUL-191125
Legemiddel- og utstyrsinformasjon, studiedokumenter
Studerer et amerikansk FDA-regulert medikamentprodukt
Studerer et amerikansk FDA-regulert enhetsprodukt
Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .