- ICH GCP
- US Clinical Trials Registry
- Klinisk utprøving NCT07328815
Redusere automatiseringsbias i lege-LLM-diagnostisk resonnering ved hjelp av atferdsmessige dytt
Begrense automatiseringstendens i lege-LLM-diagnostisk resonnering ved bruk av atferdsnudging
Målet med denne randomiserte kontrollerte studien er å evaluere om atferdsnudger kan redusere automatiseringsbias, den ukritiske aksepten av automatiserte resultater, hos leger som bruker store språkmodeller (LLM) som ChatGPT-5.1 for klinisk beslutningstaking.
Hovedspørsmålet den tar sikte på å besvare er: Reduserer en dual-mekanisme atferdsnudge-intervensjon (baseline nøyaktighetsforankring pluss case-spesifikke fargekodet tillitssignaler) legers ukritiske aksept av feil LLM-anbefalinger?
Forskere vil sammenligne leger som mottar LLM-anbefalinger sammen med en atferdsnudge med de som mottar LLM-anbefalinger uten nudge for å vurdere om nudgen reduserer automatiseringsbias.
Deltakere vil:
- Evalue seks kliniske vignetter ledsaget av LLM-genererte anbefalinger (halvparten inneholder bevisste, klinisk signifikante feil).
- Kontrollgruppe: Kunne se LLM-anbefalinger i standardformat uten nudgen.
- Behandlingsgruppe: Kunne se ChatGPTs diagnostiske nøyaktighet på standard medisinske datasett som en innledende forankring, deretter motta fargekodet tillitssignaler sammen med hver anbefaling (f.eks., rød for lav tillit).
- Få sine responser evaluert av blindede vurderere som bruker en ekspertutviklet vurderingsrubrikk for å oppdage ukritisk aksept av feilaktig informasjon.
Studieoversikt
Detaljert beskrivelse
Automatiseringsbias representerer en kritisk utfordring i moderne klinisk praksis, spesielt ettersom kunstig intelligens (AI)-verktøy blir stadig mer integrert i helsearbeidsflyter. Denne kognitive fenomenet beskriver klinikeres tendens til å favorisere forslag fra automatiserte beslutningsstøttesystemer, selv når disse forslagene er feil. Ettersom store språkmodeller (LLM) som ChatGPT-5.1 får fotfeste i medisinske miljøer, må deres potensiale for å redusere feil og forbedre effektivitet vurderes opp mot en betydelig bekymring: disse modellene mangler streng medisinsk validering og kan forsterke eksisterende kognitive biaser gjennom feilaktige eller villedende anbefalinger.
Fremveksten av automatiseringsbias i medisinske kontekster reflekterer et komplekst samspill mellom miljømessige og psykologiske faktorer. Tidsbegrensninger i kliniske settinger med høyt volum skaper press for å akseptere AI-genererte anbefalinger uten tilstrekkelig granskning. Økonomiske insentiver som prioriterer effektivitet over grundighet kan ytterligere fraråde kritisk vurdering som er nødvendig for god klinisk dømmekraft. Kognitiv utmattelse under lange skift reduserer legers kapasitet for vedvarende analytisk tenkning. Disse påvirkningene samhandler med psykologiske mekanismer inkludert ansvarsdiffusjon, overmot i teknologiske løsninger og kognitiv avlasting, og skaper kollektivt forhold hvor ukritisk aksept av AI-genererte anbefalinger blir mer sannsynlig.
Denne randomiserte kontrollerte studien evaluerer effektiviteten av en atferdsnudge-intervensjon designet for å redusere automatiseringsbias blant leger som bruker LLM-genererte diagnostiske anbefalinger. Det primære målet er å avgjøre om denne intervensjonen forbedrer diagnostisk resonneringsprestasjonsskår når man evaluerer kliniske vignetter som inkluderer bevisst feilaktige LLM-anbefalinger. Sekundære mål inkluderer å vurdere om legers erfaring, kjønn og tidligere LLM-erfaring modererer intervensjonens effektivitet, og å fastslå differensiell effektivitet for vignetter med ulike konfidenssignaler.
Denne studien benytter en enkeltblind, randomisert kontrollert studie med to parallelle grupper. Deltakere vil bli tilfeldig tildelt 1:1 til enten intervensjons- eller kontrollgruppen. For å eliminere variasjon fra forskjeller i promptingferdigheter, vil deltakerne ikke interagere direkte med et levende LLM-grensesnitt. I stedet vil alle deltakere bruke en spesialbygd nettplattform som viser kliniske vignetter med forhåndsgenererte LLM-anbefalinger, noe som sikrer identisk LLM-generert innhold for hver vignett.
Alle deltakere vil evaluere seks kliniske vignetter i løpet av en enkelt, overvåket økt som varer omtrent 75 minutter. Tre vignetter vil inneholde bevisst innførte kliniske resonneringsfeil i LLM-anbefalingene, mens tre vil inneholde korrekte anbefalinger. Vignetter vil bli presentert i tilfeldig rekkefølge for å forhindre mønstergjenkjenning.
Deltakere i kontrollgruppen vil evaluere kliniske vignetter med LLM-diagnostiske anbefalinger generert av ChatGPT presentert i standard, nøytral tekstformat uten ytterligere kontekstuell informasjon. Deltakere i intervensjonsgruppen vil evaluere de samme vignettene sammen med en atferdsnudge. Denne intervensjonen består av to synkroniserte kognitive signaler: (1) et forankringssignal som viser ChatGPTs basisdiagnostiske nøyaktighet på standard medisinske datasett øverst i grensesnittpanelet, som eksplisitt foranker forventninger til modellens feilbarhet, og (2) et selektivt oppmerksomhetssignal som viser LLM-anbefalingen sammen med et fargekodet konfidenssignal generert gjennom en ensemblevurdering: tre uavhengige toppmoderne LLM-er (Claude Sonnet 4.5, Gemini 2.5 Pro Thinking og GPT-5.1) gir hver sin konfidensvurdering for anbefalingen, og gjennomsnittskonfidensen bestemmer signalets farge for å redusere enkeltmodell-feilkalibrering.
De fargekodede konfidenssignalene er kategorisert i tre distinkte nivåer basert på ensemblets gjennomsnittskonfidens i forhold til basisdiagnostisk nøyaktighet. Røde signaler utløses når gjennomsnittskonfidensen faller under ChatGPTs etablerte basisnøyaktighet, og flagger eksplisitt høyt usikre tilfeller som krever økt kritisk granskning. Oransje signaler indikerer at mens gjennomsnittskonfidensen overstiger basisgjennomsnittet, forblir den under 100%, noe som signaliserer behovet for vedvarende klinisk årvåkenhet og unngåelse av selvtilfredshet. Til slutt er grønne signaler reservert for tilfeller med 100% ensemblekonsensus; imidlertid, selv på dette konfidensnivået, forblir standard AI-sikkerhetsadvarsler til stede for å beskytte mot overavhengighet av systemets output.
Deltakere vil bli presentert med seks kliniske vignetter spesielt designet for å måle automatiseringsbias, hentet og modifisert fra virkelige tilfeller som representerer et spekter av diagnostisk vanskelighetsgrad og vanlige medisinske spesialiteter. Hver vignett følger et standardisert format inkludert hovedklage, sykdomshistorikk, relevant tidligere medisinsk/sosial/familiehistorie, fysiske undersøkelsesfunn og initielle laboratorieresultater.
Det primære utfallsmålet er Diagnostic Reasoning Performance Score, en sammensatt prosentskår basert på en strukturert rubrikk som evaluerer: kvalitet på differensialdiagnoser, støttende funn, motstridende funn, nøyaktighet av endelig diagnose og egnethet av neste skritt. Sekundære utfallsmål inkluderer toppvalg-diagnosenøyaktighet (feil, delvis korrekt eller korrekt). Alle svar vil bli evaluert av blindede vurderere ved bruk av vurderingsrubrikken.
Studietype
Registrering (Faktiske)
Fase
- Ikke aktuelt
Kontakter og plasseringer
Studiesteder
-
-
Punjab Province
-
Lahore, Punjab Province, Pakistan, 54792
- Lahore University of Management Sciences
-
-
Deltakelseskriterier
Kvalifikasjonskriterier
Alder som er kvalifisert for studier
- Barn
- Voksen
- Eldre voksen
Tar imot friske frivillige
Beskrivelse
Inklusjonskriterier:
- Fullstendig eller midlertidig godkjente leger registrert i Pakistan Medical and Dental Council (PMDC).
- Fullført Bachelor of Medicine, Bachelor of Surgery (MBBS)-eksamen. Tilsvarende grad til MBBS i USA og Canada er Doctor of Medicine (MD).
- Deltakere må ha fullført et strukturert opplæringsprogram i bruk av ChatGPT (eller en tilsvarende stor språkmodell), med minst 10 timer undervisning. Programmet må inkludere praktisk trening knyttet til hovedaspekter ved store språkmodeller, spesielt prompt engineering og innholdsevaluering.
Eksklusjonskriterier:
- Alle andre registrerte helsepersonell (fullstendig eller midlertidig godkjent) hos PMDC (f.eks. profesjonelle med Bachelor of Dental Surgery eller BDS).
Studieplan
Hvordan er studiet utformet?
Designdetaljer
- Primært formål: Diagnostisk
- Tildeling: Randomisert
- Intervensjonsmodell: Parallell tildeling
- Masking: Enkelt
Våpen og intervensjoner
Deltakergruppe / Arm |
Intervensjon / Behandling |
|---|---|
|
Aktiv komparator: ChatGPT-anbefalinger sammen med et atferdsdytt
Deltakerne vil evaluere seks kliniske vignetter.
Under forsøket vil de ha tilgang til kliniske anbefalinger fra en spesifikk, kommersielt tilgjengelig LLM (ChatGPT) i tillegg til konvensjonelle diagnostiske ressurser.
LLM-anbefalinger for tre vignetter vil inneholde bevisst feilaktig diagnostisk informasjon og for tre vignetter vil den inneholde nøyaktige anbefalinger).
Sakene vil bli presentert i tilfeldig rekkefølge.
Deltakere i denne armen vil motta et atferdsdytt innebygd i LLM-anbefalingenes grensesnitt som presenterer to synkroniserte kognitive signaler når LLM-panelet er utvidet: (1) et forankringssignal som viser ChatGPTs grunnlinje diagnostisk nøyaktighet på standard medisinske datasett øverst i panelet for å sette realistiske forventninger før signalintervensjonen plassert umiddelbart under, som viser LLM-anbefalingene sammen med et saksspesifikt fargekodet tillitssignal.
|
Deltakere i behandlingsgruppen vil motta en atferdsmessig nudge-intervensjon innebygd i LLM-anbefalingsgrensesnittet som presenterer to synkroniserte kognitive signaler når LLM-panelet er utvidet: (1) et ankersignal som viser ChatGPTs grunnlinjediagnostiske nøyaktighet på standard medisinske datasett øverst i panelet for å sette realistiske forventninger før man ser den spesifikke anbefalingen, og (2) et selektivt oppmerksomhetssignal plassert umiddelbart under, som viser LLM-anbefalingen sammen med et saks-spesifikt og fargekodet tillitssignal.
Dette signalet kategoriseres som rødt når gjennomsnittlig ensemble-tillit faller under den etablerte grunnlinjenøyaktigheten, som markerer høyt usikre tilfeller som krever kritisk evaluering; oransje når tilliten oppfyller eller overstiger grunnlinjen men forblir under 100%, ment for å forhindre selvtilfredshet og opprettholde aktiv klinisk granskning; og grønt for 100% ensemble-konsensus, selv om standard forsiktighetsadvarsler fortsatt gjelder for å beskytte mot feil.
|
|
Ingen inngripen: ChatGPT-anbefalinger uten en atferdsmessig puff
Deltakerne vil evaluere seks kliniske vignetter.
Under forsøket vil de ha tilgang til kliniske anbefalinger fra en spesifikk, kommersielt tilgjengelig LLM (ChatGPT) i tillegg til konvensjonelle diagnostiske ressurser.
LLM-anbefalinger for tre vignetter vil inneholde bevisst feilaktig diagnostisk informasjon.
Sakene vil bli presentert i tilfeldig rekkefølge.
Deltakerne i denne armen vil ikke motta noen atferdsmessig puff.
|
Hva måler studien?
Primære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
Nøyaktighetsscore for diagnostisk resonnering
Tidsramme: Vurdert på et enkelt tidspunkt for hvert tilfelle, under den planlagte diagnostiske resonneringsvurderingsøkten, som finner sted mellom 0-5 dager etter deltakerinnmelding.
|
Det primære resultatmålet vil være prosentandel korrekt for hvert tilfelle, fra 0 til 100%, hvor høyere poengsummer indikerer bedre diagnostisk ytelse.
For hvert tilfelle vil deltakerne bli bedt om sine tre viktigste diagnoser, funn som støtter hver diagnose, og funn som motsier hver diagnose.
For hver plausibel diagnose vil deltakerne motta 1 poeng.
Funn som støtter diagnosen og funn som motsier diagnosen vil også bli vurdert basert på korrekthet, med 1 poeng for hvert korrekt svar.
Deltakerne vil deretter bli bedt om å navngi sin toppdiagnose de mener er mest sannsynlig, og tjene 9 poeng for et rimelig svar og 18 poeng for det mest nøyaktige svaret.
Til slutt vil deltakerne bli bedt om å navngi opptil 3 neste trinn for å videre evaluere pasienten med 0,5 poeng tildelt for et delvis korrekt svar og 1 poeng for et helt korrekt svar.
Det primære resultatmålet vil bli sammenlignet på tilfellesnivå mellom de randomiserte gruppene.
|
Vurdert på et enkelt tidspunkt for hvert tilfelle, under den planlagte diagnostiske resonneringsvurderingsøkten, som finner sted mellom 0-5 dager etter deltakerinnmelding.
|
Sekundære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
Toppvalg diagnose nøyaktighetsscore
Tidsramme: Vurdert ved et enkelt tidspunkt for hvert tilfelle, under den planlagte diagnostiske resonneringsvurderingsøkten, som finner sted mellom 0–5 dager etter deltakerregistrering.
|
Sekundærmålet vil måle deltakernes evne til å identifisere den mest sannsynlige diagnosen for hver kliniske vignett.
Etter å ha evaluert hvert tilfelle, vil deltakerne velge sin eneste mest sannsynlige diagnose, som vil bli vurdert på en forhåndsdefinert tre-trinns diagnostisk nøyaktighetsskala: 18 poeng for den mest nøyaktige diagnosen, 9 poeng for et klinisk fornuftig alternativ og 0 poeng for en feil diagnose.
For hver deltaker beregnes en Toppvalg Diagnosenøyaktighetsscore som (totalt opptjente poeng ÷ maksimalt mulige poeng) × 100, noe som gir et område på 0-100 % der høyere score indikerer større diagnostisk nøyaktighet.
Denne prosentscoren vil bli sammenlignet på kasusnivå mellom randomiserte grupper for å kvantifisere effekten av automatiseringsbias på diagnostisk beslutningstaking.
|
Vurdert ved et enkelt tidspunkt for hvert tilfelle, under den planlagte diagnostiske resonneringsvurderingsøkten, som finner sted mellom 0–5 dager etter deltakerregistrering.
|
Samarbeidspartnere og etterforskere
Etterforskere
- Hovedetterforsker: Muhammad Asadullah Khawaja, MBBS, King Edward Medical University
- Hovedetterforsker: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences (LUMS)
- Hovedetterforsker: Ali Zafar Sheikh, MBBS, Lahore General Hospital
- Hovedetterforsker: Muhammad Junaid Akhtar, MBBS, Children's Hospital, Lahore
- Hovedetterforsker: Muhammad Hamad Alizai, PhD, Lahore University of Management Sciences (LUMS)
Studierekorddatoer
Studer hoveddatoer
Studiestart (Faktiske)
Primær fullføring (Faktiske)
Studiet fullført (Faktiske)
Datoer for studieregistrering
Først innsendt
Først innsendt som oppfylte QC-kriteriene
Først lagt ut (Faktiske)
Oppdateringer av studieposter
Sist oppdatering lagt ut (Faktiske)
Siste oppdatering sendt inn som oppfylte QC-kriteriene
Sist bekreftet
Mer informasjon
Begreper knyttet til denne studien
Nøkkelord
Ytterligere relevante MeSH-vilkår
Andre studie-ID-numre
- LUMS-IRB-0412/12192025/IAQ-FWA
Plan for individuelle deltakerdata (IPD)
Planlegger du å dele individuelle deltakerdata (IPD)?
Legemiddel- og utstyrsinformasjon, studiedokumenter
Studerer et amerikansk FDA-regulert medikamentprodukt
Studerer et amerikansk FDA-regulert enhetsprodukt
Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .