Denne siden ble automatisk oversatt og nøyaktigheten av oversettelsen er ikke garantert. Vennligst referer til engelsk versjon for en kildetekst.

Redusere automatiseringsbias i lege-LLM-diagnostisk resonnering ved hjelp av atferdsmessige dytt

24. juni 2026 oppdatert av: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences

Begrense automatiseringstendens i lege-LLM-diagnostisk resonnering ved bruk av atferdsnudging

Målet med denne randomiserte kontrollerte studien er å evaluere om atferdsnudger kan redusere automatiseringsbias, den ukritiske aksepten av automatiserte resultater, hos leger som bruker store språkmodeller (LLM) som ChatGPT-5.1 for klinisk beslutningstaking.

Hovedspørsmålet den tar sikte på å besvare er: Reduserer en dual-mekanisme atferdsnudge-intervensjon (baseline nøyaktighetsforankring pluss case-spesifikke fargekodet tillitssignaler) legers ukritiske aksept av feil LLM-anbefalinger?

Forskere vil sammenligne leger som mottar LLM-anbefalinger sammen med en atferdsnudge med de som mottar LLM-anbefalinger uten nudge for å vurdere om nudgen reduserer automatiseringsbias.

Deltakere vil:

  • Evalue seks kliniske vignetter ledsaget av LLM-genererte anbefalinger (halvparten inneholder bevisste, klinisk signifikante feil).
  • Kontrollgruppe: Kunne se LLM-anbefalinger i standardformat uten nudgen.
  • Behandlingsgruppe: Kunne se ChatGPTs diagnostiske nøyaktighet på standard medisinske datasett som en innledende forankring, deretter motta fargekodet tillitssignaler sammen med hver anbefaling (f.eks., rød for lav tillit).
  • Få sine responser evaluert av blindede vurderere som bruker en ekspertutviklet vurderingsrubrikk for å oppdage ukritisk aksept av feilaktig informasjon.

Studieoversikt

Status

Fullført

Forhold

Intervensjon / Behandling

Detaljert beskrivelse

Automatiseringsbias representerer en kritisk utfordring i moderne klinisk praksis, spesielt ettersom kunstig intelligens (AI)-verktøy blir stadig mer integrert i helsearbeidsflyter. Denne kognitive fenomenet beskriver klinikeres tendens til å favorisere forslag fra automatiserte beslutningsstøttesystemer, selv når disse forslagene er feil. Ettersom store språkmodeller (LLM) som ChatGPT-5.1 får fotfeste i medisinske miljøer, må deres potensiale for å redusere feil og forbedre effektivitet vurderes opp mot en betydelig bekymring: disse modellene mangler streng medisinsk validering og kan forsterke eksisterende kognitive biaser gjennom feilaktige eller villedende anbefalinger.

Fremveksten av automatiseringsbias i medisinske kontekster reflekterer et komplekst samspill mellom miljømessige og psykologiske faktorer. Tidsbegrensninger i kliniske settinger med høyt volum skaper press for å akseptere AI-genererte anbefalinger uten tilstrekkelig granskning. Økonomiske insentiver som prioriterer effektivitet over grundighet kan ytterligere fraråde kritisk vurdering som er nødvendig for god klinisk dømmekraft. Kognitiv utmattelse under lange skift reduserer legers kapasitet for vedvarende analytisk tenkning. Disse påvirkningene samhandler med psykologiske mekanismer inkludert ansvarsdiffusjon, overmot i teknologiske løsninger og kognitiv avlasting, og skaper kollektivt forhold hvor ukritisk aksept av AI-genererte anbefalinger blir mer sannsynlig.

Denne randomiserte kontrollerte studien evaluerer effektiviteten av en atferdsnudge-intervensjon designet for å redusere automatiseringsbias blant leger som bruker LLM-genererte diagnostiske anbefalinger. Det primære målet er å avgjøre om denne intervensjonen forbedrer diagnostisk resonneringsprestasjonsskår når man evaluerer kliniske vignetter som inkluderer bevisst feilaktige LLM-anbefalinger. Sekundære mål inkluderer å vurdere om legers erfaring, kjønn og tidligere LLM-erfaring modererer intervensjonens effektivitet, og å fastslå differensiell effektivitet for vignetter med ulike konfidenssignaler.

Denne studien benytter en enkeltblind, randomisert kontrollert studie med to parallelle grupper. Deltakere vil bli tilfeldig tildelt 1:1 til enten intervensjons- eller kontrollgruppen. For å eliminere variasjon fra forskjeller i promptingferdigheter, vil deltakerne ikke interagere direkte med et levende LLM-grensesnitt. I stedet vil alle deltakere bruke en spesialbygd nettplattform som viser kliniske vignetter med forhåndsgenererte LLM-anbefalinger, noe som sikrer identisk LLM-generert innhold for hver vignett.

Alle deltakere vil evaluere seks kliniske vignetter i løpet av en enkelt, overvåket økt som varer omtrent 75 minutter. Tre vignetter vil inneholde bevisst innførte kliniske resonneringsfeil i LLM-anbefalingene, mens tre vil inneholde korrekte anbefalinger. Vignetter vil bli presentert i tilfeldig rekkefølge for å forhindre mønstergjenkjenning.

Deltakere i kontrollgruppen vil evaluere kliniske vignetter med LLM-diagnostiske anbefalinger generert av ChatGPT presentert i standard, nøytral tekstformat uten ytterligere kontekstuell informasjon. Deltakere i intervensjonsgruppen vil evaluere de samme vignettene sammen med en atferdsnudge. Denne intervensjonen består av to synkroniserte kognitive signaler: (1) et forankringssignal som viser ChatGPTs basisdiagnostiske nøyaktighet på standard medisinske datasett øverst i grensesnittpanelet, som eksplisitt foranker forventninger til modellens feilbarhet, og (2) et selektivt oppmerksomhetssignal som viser LLM-anbefalingen sammen med et fargekodet konfidenssignal generert gjennom en ensemblevurdering: tre uavhengige toppmoderne LLM-er (Claude Sonnet 4.5, Gemini 2.5 Pro Thinking og GPT-5.1) gir hver sin konfidensvurdering for anbefalingen, og gjennomsnittskonfidensen bestemmer signalets farge for å redusere enkeltmodell-feilkalibrering.

De fargekodede konfidenssignalene er kategorisert i tre distinkte nivåer basert på ensemblets gjennomsnittskonfidens i forhold til basisdiagnostisk nøyaktighet. Røde signaler utløses når gjennomsnittskonfidensen faller under ChatGPTs etablerte basisnøyaktighet, og flagger eksplisitt høyt usikre tilfeller som krever økt kritisk granskning. Oransje signaler indikerer at mens gjennomsnittskonfidensen overstiger basisgjennomsnittet, forblir den under 100%, noe som signaliserer behovet for vedvarende klinisk årvåkenhet og unngåelse av selvtilfredshet. Til slutt er grønne signaler reservert for tilfeller med 100% ensemblekonsensus; imidlertid, selv på dette konfidensnivået, forblir standard AI-sikkerhetsadvarsler til stede for å beskytte mot overavhengighet av systemets output.

Deltakere vil bli presentert med seks kliniske vignetter spesielt designet for å måle automatiseringsbias, hentet og modifisert fra virkelige tilfeller som representerer et spekter av diagnostisk vanskelighetsgrad og vanlige medisinske spesialiteter. Hver vignett følger et standardisert format inkludert hovedklage, sykdomshistorikk, relevant tidligere medisinsk/sosial/familiehistorie, fysiske undersøkelsesfunn og initielle laboratorieresultater.

Det primære utfallsmålet er Diagnostic Reasoning Performance Score, en sammensatt prosentskår basert på en strukturert rubrikk som evaluerer: kvalitet på differensialdiagnoser, støttende funn, motstridende funn, nøyaktighet av endelig diagnose og egnethet av neste skritt. Sekundære utfallsmål inkluderer toppvalg-diagnosenøyaktighet (feil, delvis korrekt eller korrekt). Alle svar vil bli evaluert av blindede vurderere ved bruk av vurderingsrubrikken.

Studietype

Intervensjonell

Registrering (Faktiske)

72

Fase

  • Ikke aktuelt

Kontakter og plasseringer

Denne delen inneholder kontaktinformasjon for de som utfører studien, og informasjon om hvor denne studien blir utført.

Studiesteder

    • Punjab Province
      • Lahore, Punjab Province, Pakistan, 54792
        • Lahore University of Management Sciences

Deltakelseskriterier

Forskere ser etter personer som passer til en bestemt beskrivelse, kalt kvalifikasjonskriterier. Noen eksempler på disse kriteriene er en persons generelle helsetilstand eller tidligere behandlinger.

Kvalifikasjonskriterier

Alder som er kvalifisert for studier

  • Barn
  • Voksen
  • Eldre voksen

Tar imot friske frivillige

Ja

Beskrivelse

Inklusjonskriterier:

  • Fullstendig eller midlertidig godkjente leger registrert i Pakistan Medical and Dental Council (PMDC).
  • Fullført Bachelor of Medicine, Bachelor of Surgery (MBBS)-eksamen. Tilsvarende grad til MBBS i USA og Canada er Doctor of Medicine (MD).
  • Deltakere må ha fullført et strukturert opplæringsprogram i bruk av ChatGPT (eller en tilsvarende stor språkmodell), med minst 10 timer undervisning. Programmet må inkludere praktisk trening knyttet til hovedaspekter ved store språkmodeller, spesielt prompt engineering og innholdsevaluering.

Eksklusjonskriterier:

  • Alle andre registrerte helsepersonell (fullstendig eller midlertidig godkjent) hos PMDC (f.eks. profesjonelle med Bachelor of Dental Surgery eller BDS).

Studieplan

Denne delen gir detaljer om studieplanen, inkludert hvordan studien er utformet og hva studien måler.

Hvordan er studiet utformet?

Designdetaljer

  • Primært formål: Diagnostisk
  • Tildeling: Randomisert
  • Intervensjonsmodell: Parallell tildeling
  • Masking: Enkelt

Våpen og intervensjoner

Deltakergruppe / Arm
Intervensjon / Behandling
Aktiv komparator: ChatGPT-anbefalinger sammen med et atferdsdytt
Deltakerne vil evaluere seks kliniske vignetter. Under forsøket vil de ha tilgang til kliniske anbefalinger fra en spesifikk, kommersielt tilgjengelig LLM (ChatGPT) i tillegg til konvensjonelle diagnostiske ressurser. LLM-anbefalinger for tre vignetter vil inneholde bevisst feilaktig diagnostisk informasjon og for tre vignetter vil den inneholde nøyaktige anbefalinger). Sakene vil bli presentert i tilfeldig rekkefølge. Deltakere i denne armen vil motta et atferdsdytt innebygd i LLM-anbefalingenes grensesnitt som presenterer to synkroniserte kognitive signaler når LLM-panelet er utvidet: (1) et forankringssignal som viser ChatGPTs grunnlinje diagnostisk nøyaktighet på standard medisinske datasett øverst i panelet for å sette realistiske forventninger før signalintervensjonen plassert umiddelbart under, som viser LLM-anbefalingene sammen med et saksspesifikt fargekodet tillitssignal.
Deltakere i behandlingsgruppen vil motta en atferdsmessig nudge-intervensjon innebygd i LLM-anbefalingsgrensesnittet som presenterer to synkroniserte kognitive signaler når LLM-panelet er utvidet: (1) et ankersignal som viser ChatGPTs grunnlinjediagnostiske nøyaktighet på standard medisinske datasett øverst i panelet for å sette realistiske forventninger før man ser den spesifikke anbefalingen, og (2) et selektivt oppmerksomhetssignal plassert umiddelbart under, som viser LLM-anbefalingen sammen med et saks-spesifikt og fargekodet tillitssignal. Dette signalet kategoriseres som rødt når gjennomsnittlig ensemble-tillit faller under den etablerte grunnlinjenøyaktigheten, som markerer høyt usikre tilfeller som krever kritisk evaluering; oransje når tilliten oppfyller eller overstiger grunnlinjen men forblir under 100%, ment for å forhindre selvtilfredshet og opprettholde aktiv klinisk granskning; og grønt for 100% ensemble-konsensus, selv om standard forsiktighetsadvarsler fortsatt gjelder for å beskytte mot feil.
Ingen inngripen: ChatGPT-anbefalinger uten en atferdsmessig puff
Deltakerne vil evaluere seks kliniske vignetter. Under forsøket vil de ha tilgang til kliniske anbefalinger fra en spesifikk, kommersielt tilgjengelig LLM (ChatGPT) i tillegg til konvensjonelle diagnostiske ressurser. LLM-anbefalinger for tre vignetter vil inneholde bevisst feilaktig diagnostisk informasjon. Sakene vil bli presentert i tilfeldig rekkefølge. Deltakerne i denne armen vil ikke motta noen atferdsmessig puff.

Hva måler studien?

Primære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
Nøyaktighetsscore for diagnostisk resonnering
Tidsramme: Vurdert på et enkelt tidspunkt for hvert tilfelle, under den planlagte diagnostiske resonneringsvurderingsøkten, som finner sted mellom 0-5 dager etter deltakerinnmelding.
Det primære resultatmålet vil være prosentandel korrekt for hvert tilfelle, fra 0 til 100%, hvor høyere poengsummer indikerer bedre diagnostisk ytelse. For hvert tilfelle vil deltakerne bli bedt om sine tre viktigste diagnoser, funn som støtter hver diagnose, og funn som motsier hver diagnose. For hver plausibel diagnose vil deltakerne motta 1 poeng. Funn som støtter diagnosen og funn som motsier diagnosen vil også bli vurdert basert på korrekthet, med 1 poeng for hvert korrekt svar. Deltakerne vil deretter bli bedt om å navngi sin toppdiagnose de mener er mest sannsynlig, og tjene 9 poeng for et rimelig svar og 18 poeng for det mest nøyaktige svaret. Til slutt vil deltakerne bli bedt om å navngi opptil 3 neste trinn for å videre evaluere pasienten med 0,5 poeng tildelt for et delvis korrekt svar og 1 poeng for et helt korrekt svar. Det primære resultatmålet vil bli sammenlignet på tilfellesnivå mellom de randomiserte gruppene.
Vurdert på et enkelt tidspunkt for hvert tilfelle, under den planlagte diagnostiske resonneringsvurderingsøkten, som finner sted mellom 0-5 dager etter deltakerinnmelding.

Sekundære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
Toppvalg diagnose nøyaktighetsscore
Tidsramme: Vurdert ved et enkelt tidspunkt for hvert tilfelle, under den planlagte diagnostiske resonneringsvurderingsøkten, som finner sted mellom 0–5 dager etter deltakerregistrering.
Sekundærmålet vil måle deltakernes evne til å identifisere den mest sannsynlige diagnosen for hver kliniske vignett. Etter å ha evaluert hvert tilfelle, vil deltakerne velge sin eneste mest sannsynlige diagnose, som vil bli vurdert på en forhåndsdefinert tre-trinns diagnostisk nøyaktighetsskala: 18 poeng for den mest nøyaktige diagnosen, 9 poeng for et klinisk fornuftig alternativ og 0 poeng for en feil diagnose. For hver deltaker beregnes en Toppvalg Diagnosenøyaktighetsscore som (totalt opptjente poeng ÷ maksimalt mulige poeng) × 100, noe som gir et område på 0-100 % der høyere score indikerer større diagnostisk nøyaktighet. Denne prosentscoren vil bli sammenlignet på kasusnivå mellom randomiserte grupper for å kvantifisere effekten av automatiseringsbias på diagnostisk beslutningstaking.
Vurdert ved et enkelt tidspunkt for hvert tilfelle, under den planlagte diagnostiske resonneringsvurderingsøkten, som finner sted mellom 0–5 dager etter deltakerregistrering.

Samarbeidspartnere og etterforskere

Det er her du vil finne personer og organisasjoner som er involvert i denne studien.

Etterforskere

  • Hovedetterforsker: Muhammad Asadullah Khawaja, MBBS, King Edward Medical University
  • Hovedetterforsker: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences (LUMS)
  • Hovedetterforsker: Ali Zafar Sheikh, MBBS, Lahore General Hospital
  • Hovedetterforsker: Muhammad Junaid Akhtar, MBBS, Children's Hospital, Lahore
  • Hovedetterforsker: Muhammad Hamad Alizai, PhD, Lahore University of Management Sciences (LUMS)

Studierekorddatoer

Disse datoene sporer fremdriften for innsending av studieposter og sammendragsresultater til ClinicalTrials.gov. Studieposter og rapporterte resultater gjennomgås av National Library of Medicine (NLM) for å sikre at de oppfyller spesifikke kvalitetskontrollstandarder før de legges ut på det offentlige nettstedet.

Studer hoveddatoer

Studiestart (Faktiske)

17. januar 2026

Primær fullføring (Faktiske)

25. mai 2026

Studiet fullført (Faktiske)

26. mai 2026

Datoer for studieregistrering

Først innsendt

26. desember 2025

Først innsendt som oppfylte QC-kriteriene

26. desember 2025

Først lagt ut (Faktiske)

9. januar 2026

Oppdateringer av studieposter

Sist oppdatering lagt ut (Faktiske)

25. juni 2026

Siste oppdatering sendt inn som oppfylte QC-kriteriene

24. juni 2026

Sist bekreftet

1. juni 2026

Mer informasjon

Begreper knyttet til denne studien

Plan for individuelle deltakerdata (IPD)

Planlegger du å dele individuelle deltakerdata (IPD)?

NEI

Legemiddel- og utstyrsinformasjon, studiedokumenter

Studerer et amerikansk FDA-regulert medikamentprodukt

Nei

Studerer et amerikansk FDA-regulert enhetsprodukt

Nei

Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .

Abonnere