- ICH GCP
- Amerikanska kliniska prövningsregistret
- Klinisk prövning NCT07328815
Mildrande av automatiseringsbias i läkare-LLM-diagnostisk resonemang genom beteendestyrning
Att mildra automatiseringsbias i läkare-LLM-diagnostiskt resonemang med hjälp av beteendepåtryckningar
Syftet med denna randomiserade kontrollerade studie är att utvärdera om beteendestyrning kan minska automatiseringsbias, det okritiska accepterandet av automatiserad utdata, hos läkare som använder stora språkmodeller (LLM) som ChatGPT-5.1 för kliniskt beslutsfattande.
Den huvudsakliga frågan som studien avser att besvara är: Minskar en beteendestyrningsintervention med dubbel mekanism (grundlinje noggrannhetsankring plus fallspecifika färgkodade konfidenssignaler) läkares okritiska accepterande av felaktiga LLM-rekommendationer?
Forskare kommer att jämföra läkare som får LLM-rekommendationer tillsammans med beteendestyrning med de som får LLM-rekommendationer utan styrning för att bedöma om styrningen minskar automatiseringsbias.
Deltagarna kommer att:
- Utvärdera sex kliniska vignerter åtföljda av LLM-genererade rekommendationer (hälften innehåller avsiktliga, kliniskt signifikanta fel).
- Kontrollgrupp: Kunna se LLM-rekommendationer i standardformat utan beteendestyrning.
- Behandlingsgrupp: Kunna se ChatGPT:s diagnostiska noggrannhet på standardiserade medicinska dataset som en initial ankare, sedan få färgkodade konfidenssignaler tillsammans med varje rekommendation (t.ex. röd för låg konfidens).
- Få sina svar utvärderade av blindade granskare med hjälp av en expertutvecklad bedömningsrubrik för att upptäcka okritiskt accepterande av felaktig information.
Studieöversikt
Detaljerad beskrivning
Automatiseringsbias utgör en kritisk utmaning i modern klinisk praxis, särskilt när artificiell intelligens (AI) verktyg blir allt mer integrerade i hälso- och sjukvårdsarbetsflöden. Detta kognitiva fenomen beskriver klinikers tendens att föredra förslag från automatiserade beslutsstödssystem, även när dessa förslag är felaktiga. När stora språkmodeller (LLM) som ChatGPT-5.1 får fäste i medicinska sammanhang måste deras potential att minska fel och förbättra effektiviteten vägas mot en betydande oro: dessa modeller saknar rigorös medicinsk validering och kan förstärka befintliga kognitiva bias genom felaktiga eller vilseledande rekommendationer.
Förekomsten av automatiseringbias i medicinska sammanhang återspeglar en komplex samverkan mellan miljömässiga och psykologiska faktorer. Tidsbegränsningar i högvolymskliniska miljöer skapar press att acceptera AI-genererade rekommendationer utan tillräcklig granskning. Finansiella incitament som prioriterar effektivitet framför noggrannhet kan ytterligare avskräcka från den kritiska utvärdering som krävs för sund klinisk bedömning. Kognitiv trötthet under långa skift minskar läkares kapacitet för ihållande analytiskt tänkande. Dessa påfrestningar samverkar med psykologiska mekanismer inklusive ansvarsfördelning, övermod i tekniska lösningar och kognitiv avlastning, vilket kollektivt skapar förutsättningar där okritiskt godtagande av AI-genererade rekommendationer blir mer sannolikt.
Denna randomiserade kontrollerade studie utvärderar effektiviteten av en beteendepåverkande intervention utformad för att minska automatiseringbias bland läkare som använder LLM-genererade diagnostiska rekommendationer. Det primära målet är att avgöra om denna intervention förbättrar diagnostiska resonemangsprestationspoäng vid utvärdering av kliniska vignetter som inkluderar medvetet felaktiga LLM-rekommendationer. Sekundära mål inkluderar att bedöma om läkares erfarenhetsnivå, kön och tidigare LLM-erfarenhet modererar interventionens effektivitet, samt att fastställa differentiell effektivitet för vignetter med olika konfidenssignaler.
Denna studie använder en enkelblindad, randomiserad kontrollerad studie med två parallella armar. Deltagare kommer att slumpmässigt fördelas 1:1 till antingen interventionsarmen eller kontrollarmen. För att eliminera variation från skillnader i promptfärdigheter kommer deltagarna inte att interagera direkt med ett live LLM-gränssnitt. Istället kommer alla deltagare att använda en specialbyggd webbplattform som visar kliniska vignetter med förgenererade LLM-rekommendationer, vilket säkerställer identiskt LLM-genererat innehåll för varje vignett.
Alla deltagare kommer att utvärdera sex kliniska vignetter under en enda, övervakad session som varar cirka 75 minuter. Tre vignetter kommer att innehålla medvetet införda kliniska resonemangsbrister i LLM-rekommendationerna, medan tre kommer att innehålla korrekta rekommendationer. Vignetter kommer att presenteras i slumpmässig ordning för att förhindra mönsterigenkänning.
Deltagare i kontrollarmen kommer att utvärdera kliniska vignetter med LLM-diagnostiska rekommendationer genererade av ChatGPT presenterade i standard, neutral textformat utan ytterligare kontextuell information. Deltagare i interventionsarmen kommer att utvärdera samma vignetter tillsammans med en beteendepåverkande intervention. Denna intervention består av två synkroniserade kognitiva ledtrådar: (1) en förankringsledtråd som visar ChatGPT:s baslinjediagnostiska noggrannhet på standard medicinska dataset högst upp i gränssnittspanelen, vilket explicit förankrar förväntningar till modellens felbarhet, och (2) en selektiv uppmärksamhetsledtråd som visar LLM-rekommendationen tillsammans med en färgkodad konfidenssignal genererad genom en ensemblebedömning: tre oberoende toppmoderna LLM (Claude Sonnet 4.5, Gemini 2.5 Pro Thinking och GPT-5.1) ger var och en konfidensbetyg för rekommendationen, och medelkonfidensen bestämmer signalens färg för att mildra enskild modells felkalibrering.
De färgkodade konfidenssignalerna kategoriseras i tre distinkta nivåer baserat på ensemblets medelkonfidens i förhållande till baslinjediagnostisk noggrannhet. Röda signaler utlöses när medelkonfidensen faller under ChatGPT:s etablerade baslinjenoggrannhet, vilket explicit flaggar hög-osäkerhetsfall som kräver förhöjd kritisk granskning. Orangea signaler indikerar att medan medelkonfidensen överskrider baslinjemedelvärdet, förblir den under 100%, vilket signalerar behovet av fortsatt klinisk vaksamhet och undvikande av självbelåtenhet. Slutligen är gröna signaler reserverade för instanser av 100% ensemblekonsensus; dock, även vid denna konfidensnivå, förblir standard AI-säkerhetsvarningar närvarande för att skydda mot överförlitlighet på systemets utdata.
Deltagarna kommer att presenteras med sex kliniska vignetter specifikt utformade för att mäta automatiseringbias, hämtade och modifierade från verkliga fall som representerar ett spektrum av diagnostisk svårighetsgrad och vanliga medicinska specialiteter. Varje vignett följer ett standardiserat format inklusive huvudbesvär, sjukdomshistoria, relevant medicinsk/social/familjehistoria, fynd vid fysisk undersökning och initiala laboratorieresultat.
Det primära utfallsmåttet är Diagnostic Reasoning Performance Score, ett sammansatt procentuellt poäng baserat på en strukturerad bedömningsmatris som utvärderar: kvalitet på differentialdiagnoser, stödjande fynd, motstridiga fynd, slutlig diagnosnoggrannhet och lämplighet av nästa steg. Sekundära utfallsmått inkluderar noggrannhet i förstahandsdiagnos (felaktig, delvis korrekt eller korrekt). Alla svar kommer att utvärderas av blindade granskare med hjälp av bedömningsmatrisen.
Studietyp
Inskrivning (Faktisk)
Fas
- Inte tillämpbar
Kontakter och platser
Studieorter
-
-
Punjab Province
-
Lahore, Punjab Province, Pakistan, 54792
- Lahore University of Management Sciences
-
-
Deltagandekriterier
Urvalskriterier
Åldrar som är berättigade till studier
- Barn
- Vuxen
- Äldre vuxen
Tar emot friska volontärer
Beskrivning
Inkluderingskriterier:
- Fullt eller preliminärt registrerade läkare hos Pakistan Medical and Dental Council (PMDC).
- Avslutat Bachelor of Medicine, Bachelor of Surgery (MBBS)-examen.
Motsvarande examen till MBBS i USA och Kanada är Doctor of Medicine (MD). - Deltagarna måste ha genomfört ett strukturerat utbildningsprogram i användning av ChatGPT (eller en jämförbar storspråksmodell), med totalt minst 10 timmars undervisning.
Programmet måste innehålla praktisk övning relaterad till storspråksmodellers nyckelaspekter, specifikt promptteknik och innehållsutvärdering.
Exkluderingskriterier:
- Alla andra registrerade läkare (fullt eller preliminärt) hos PMDC (t.ex. yrkesverksamma med Bachelor of Dental Surgery eller BDS).
Studieplan
Hur är studien utformad?
Designdetaljer
- Primärt syfte: Diagnostisk
- Tilldelning: Randomiserad
- Interventionsmodell: Parallellt uppdrag
- Maskning: Enda
Vapen och interventioner
Deltagargrupp / Arm |
Intervention / Behandling |
|---|---|
|
Aktiv komparator: ChatGPT-rekommendationer tillsammans med en beteendepuff
Deltagarna kommer att utvärdera sex kliniska vingetter.
Under försöket kommer de att ha tillgång till kliniska rekommendationer från en specifik, kommersiellt tillgänglig LLM (ChatGPT) utöver konventionella diagnostiska resurser.
LLM-rekommendationer för tre vingetter kommer att innehålla medvetet felaktig diagnostisk information och för tre vingetter kommer den att innehålla korrekta rekommendationer).
Fallen kommer att presenteras i slumpmässig ordning.
Deltagarna i denna arm kommer att få ett beteendestöd inbäddat i LLM-rekommendationsgränssnittet som presenterar två synkroniserade kognitiva ledtrådar när LLM-panelen expanderas: (1) en ankringsledtråd som visar ChatGPT:s baslinjediagnostiska noggrannhet på standardiserade medicinska dataset högst upp på panelen för att skapa realistiska förväntningar före ledtrådsinterventionen som finns omedelbart under, vilket visar LLM-rekommendationerna tillsammans med ett fallspecifikt färgkodat konfidenssignal.
|
Deltagarna i behandlingsgruppen kommer att få en beteendestödsintervention inbäddad i LLM-rekommendationsgränssnittet som presenterar två synkroniserade kognitiva signaler när LLM-panelen är expanderad: (1) en ankringssignal som visar ChatGPT:s baslinjediagnostiska noggrannhet på standardiserade medicinska dataset högst upp på panelen för att skapa realistiska förväntningar innan den specifika rekommendationen visas, och (2) en selektiv uppmärksamhetssignal placerad omedelbart under, som visar LLM-rekommendationen tillsammans med en fallspecifik och färgkodad säkerhetssignal.
Denna signal kategoriseras som röd när det genomsnittliga ensembleförtroendet faller under den etablerade baslinjenoggrannheten, vilket flaggar hög-osäkerhetsfall som kräver kritisk utvärdering; orange när förtroendet uppfyller eller överskrider baslinjen men fortfarande är under 100%, avsett att förhindra självbelåtenhet och upprätthålla aktiv klinisk granskning; och grön för 100% ensemblekonsensus, även om standardvarningsmeddelanden fortfarande gäller för att skydda mot.
|
|
Inget ingripande: ChatGPT-rekommendationer utan ett beteendestöd
Deltagarna kommer att utvärdera sex kliniska vignetter.
Under försöket kommer de att ha tillgång till kliniska rekommendationer från en specifik, kommersiellt tillgänglig LLM (ChatGPT) utöver konventionella diagnostiska resurser.
LLM-rekommendationer för tre vignetter kommer att innehålla avsiktligt felaktig diagnostisk information.
Fallen kommer att presenteras i slumpmässig ordning.
Deltagarna i denna arm kommer inte att få någon beteendemässig puff.
|
Vad mäter studien?
Primära resultatmått
Resultatmått |
Åtgärdsbeskrivning |
Tidsram |
|---|---|---|
|
Diagnostisk resonemangsnoggrannhetspoäng
Tidsram: Utvärderad vid en enda tidpunkt för varje fall, under den schemalagda diagnostiska resonemangssessionen, som äger rum 0-5 dagar efter deltagarregistrering.
|
Det primära utfallsmåttet kommer att vara procentandel rätt för varje fall, från 0 till 100 %, där högre poäng indikerar bättre diagnostisk prestation.
För varje fall kommer deltagarna att ombes att ange sina tre främsta diagnoser, fynd som stödjer varje diagnos och fynd som motsäger varje diagnos.
För varje rimlig diagnos kommer deltagarna att få 1 poäng.
Fynd som stödjer diagnosen och fynd som motsäger diagnosen kommer också att betygsättas baserat på korrekthet, med 1 poäng för varje korrekt svar.
Deltagarna kommer sedan att ombes att ange sin främsta diagnos som de tror är mest sannolik, där de får 9 poäng för ett rimligt svar och 18 poäng för det mest exakta svaret.
Slutligen kommer deltagarna att ombes att ange upp till 3 nästa steg för att ytterligare utvärdera patienten, med 0,5 poäng för ett delvis korrekt svar och 1 poäng för ett helt korrekt svar.
Det primära utfallsmåttet kommer att jämföras på fallnivå mellan de randomiserade grupperna.
|
Utvärderad vid en enda tidpunkt för varje fall, under den schemalagda diagnostiska resonemangssessionen, som äger rum 0-5 dagar efter deltagarregistrering.
|
Sekundära resultatmått
Resultatmått |
Åtgärdsbeskrivning |
Tidsram |
|---|---|---|
|
Toppval diagnos noggrannhetspoäng
Tidsram: Bedömdes vid en enda tidpunkt för varje fall, under den schemalagda utvärderingssessionen för diagnostiskt resonemang, som äger rum 0–5 dagar efter deltagarnas inkludering.
|
Sekundär utfallsmåttet kommer att mäta deltagarnas prestation i att identifiera den mest sannolika diagnosen för varje klinisk vignett.
Efter att ha utvärderat varje fall kommer deltagarna att välja sin enda mest sannolika diagnos, som kommer att poängsättas på en förutbestämd tre-nivås diagnostisk noggrannhetsskala: 18 poäng för den mest korrekta diagnosen, 9 poäng för ett kliniskt rimligt alternativ och 0 poäng för en felaktig diagnos.
För varje deltagare beräknas ett toppvaldiagnosnoggrannhetspoäng som (totalpoäng uppnådda ÷ maximalt möjliga poäng) × 100, vilket ger ett 0-100 % intervall där högre poäng indikerar större diagnostisk noggrannhet.
Denna procentuella poäng kommer att jämföras på fallnivå mellan randomiserade grupper för att kvantifiera effekten av automatiseringsbias på diagnostiskt beslutsfattande.
|
Bedömdes vid en enda tidpunkt för varje fall, under den schemalagda utvärderingssessionen för diagnostiskt resonemang, som äger rum 0–5 dagar efter deltagarnas inkludering.
|
Samarbetspartners och utredare
Utredare
- Huvudutredare: Muhammad Asadullah Khawaja, MBBS, King Edward Medical University
- Huvudutredare: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences (LUMS)
- Huvudutredare: Ali Zafar Sheikh, MBBS, Lahore General Hospital
- Huvudutredare: Muhammad Junaid Akhtar, MBBS, Children's Hospital, Lahore
- Huvudutredare: Muhammad Hamad Alizai, PhD, Lahore University of Management Sciences (LUMS)
Studieavstämningsdatum
Studera stora datum
Studiestart (Faktisk)
Primärt slutförande (Faktisk)
Avslutad studie (Faktisk)
Studieregistreringsdatum
Först inskickad
Först inskickad som uppfyllde QC-kriterierna
Första postat (Faktisk)
Uppdateringar av studier
Senaste uppdatering publicerad (Faktisk)
Senaste inskickade uppdateringen som uppfyllde QC-kriterierna
Senast verifierad
Mer information
Termer relaterade till denna studie
Nyckelord
Ytterligare relevanta MeSH-villkor
Andra studie-ID-nummer
- LUMS-IRB-0412/12192025/IAQ-FWA
Plan för individuella deltagardata (IPD)
Planerar du att dela individuella deltagardata (IPD)?
Läkemedels- och apparatinformation, studiedokument
Studerar en amerikansk FDA-reglerad läkemedelsprodukt
Studerar en amerikansk FDA-reglerad produktprodukt
Denna information hämtades direkt från webbplatsen clinicaltrials.gov utan några ändringar. Om du har några önskemål om att ändra, ta bort eller uppdatera dina studieuppgifter, vänligen kontakta register@clinicaltrials.gov. Så snart en ändring har implementerats på clinicaltrials.gov, kommer denna att uppdateras automatiskt även på vår webbplats .