Deze pagina is automatisch vertaald en de nauwkeurigheid van de vertaling kan niet worden gegarandeerd. Raadpleeg de Engelse versie voor een brontekst.

Mitigeren van Automatisering Bias in Arts-LLM Diagnostisch Redeneren met Gedragsinterventies

24 juni 2026 bijgewerkt door: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences

Het beperken van automatiseringsbias in arts-LLM-diagnostische redenering met behulp van gedragsnudges

Het doel van deze gerandomiseerde gecontroleerde studie is om te evalueren of gedragsnudges automatiseringsoordeel kunnen verminderen, de onkritische acceptatie van geautomatiseerde output, bij artsen die gebruik maken van grote-taalmodel (LLM) zoals ChatGPT-5.1 voor klinische besluitvorming.

De belangrijkste vraag die het beoogt te beantwoorden is: Vermindert een dual-mechanisme gedragsnudge-interventie (basisnauwkeurigheid-verankering plus casusspecifieke kleurgecodeerde vertrouwenssignalen) de onkritische acceptatie door artsen van incorrecte LLM-aanbevelingen?

Onderzoekers zullen artsen die LLM-aanbevelingen ontvangen samen met een gedragsnudge vergelijken met degenen die LLM-aanbevelingen ontvangen zonder de nudge om te beoordelen of de nudge automatiseringsoordeel vermindert.

Deelnemers zullen:

  • Zes klinische vignetten evalueren vergezeld van LLM-gegenereerde aanbevelingen (waarvan de helft opzettelijke, klinisch significante fouten bevat).
  • Controlegroep: LLM-aanbevelingen kunnen bekijken in standaardformaat zonder de nudge.
  • Interventiegroep: ChatGPT's diagnostische nauwkeurigheid op standaard medische datasets kunnen bekijken als een initieel anker, vervolgens kleurgecodeerde vertrouwenssignalen ontvangen naast elke aanbeveling (bijv. rood voor laag vertrouwen).
  • Hun reacties laten evalueren door geblindeerde beoordelaars met behulp van een door experts ontwikkelde beoordelingsrubriek om onkritische acceptatie van foutieve informatie te detecteren.

Studie Overzicht

Toestand

Voltooid

Conditie

Gedetailleerde beschrijving

Automatiseringsbias vormt een kritieke uitdaging in de moderne klinische praktijk, vooral omdat kunstmatige intelligentie (AI)-hulpmiddelen steeds meer ingebed raken in zorgwerkstromen. Dit cognitieve fenomeen beschrijft de neiging van clinici om suggesties van geautomatiseerde besluitvormingssystemen te verkiezen, zelfs wanneer die suggesties onjuist zijn. Naarmate grote taalmodellen (LLM's) zoals ChatGPT-5.1 voet aan de grond krijgen in medische omgevingen, moet hun potentieel om fouten te verminderen en efficiëntie te verbeteren worden afgewogen tegen een belangrijke zorg: deze modellen ontberen rigoureuze medische validatie en kunnen bestaande cognitieve vooroordelen versterken door onjuiste of misleidende aanbevelingen.

De opkomst van automatiseringbias in medische contexten weerspiegelt een complexe wisselwerking van omgevings- en psychologische factoren. Tijdsdruk in klinische settings met hoge volumes creëert druk om AI-gegenereerde aanbevelingen zonder voldoende toetsing te accepteren. Financiële prikkels die efficiëntie boven grondigheid stellen, kunnen de kritische evaluatie die nodig is voor een degelijk klinisch oordeel verder ontmoedigen. Cognitieve vermoeidheid tijdens lange diensten vermindert het vermogen van artsen voor aanhoudend analytisch denken. Deze druk interageert met psychologische mechanismen, waaronder verantwoordelijkheidsdiffusie, overmoed in technologische oplossingen en cognitieve ontlasting, die gezamenlijk omstandigheden creëren waarin onkritische acceptatie van AI-gegenereerde aanbevelingen waarschijnlijker wordt.

Deze gerandomiseerde gecontroleerde studie evalueert de effectiviteit van een gedragsinterventie ('nudge') die is ontworpen om automatiseringbias te verminderen onder artsen die gebruikmaken van LLM-gegenereerde diagnostische aanbevelingen. Het primaire doel is om te bepalen of deze interventie de prestatiescores voor diagnostisch redeneren verbetert bij het evalueren van klinische vignetten die opzettelijk gebrekkige LLM-aanbevelingen bevatten. Secundaire doelstellingen omvatten het beoordelen of het ervaringsniveau, geslacht en eerdere LLM-ervaring van de arts de effectiviteit van de interventie modereren, en het bepalen van het differentiële effect voor vignetten met verschillende betrouwbaarheidssignalen.

Deze studie gebruikt een enkelblinde, gerandomiseerde gecontroleerde trial met twee parallelle armen. Deelnemers worden willekeurig 1:1 toegewezen aan de interventie- of controlearm. Om variabiliteit door verschillen in promptvaardigheden te elimineren, zullen deelnemers niet direct interacteren met een live LLM-interface. In plaats daarvan zullen alle deelnemers een speciaal gebouwd webplatform gebruiken dat klinische vignetten toont met vooraf gegenereerde LLM-aanbevelingen, waardoor identieke LLM-gegenereerde inhoud voor elk vignet wordt gegarandeerd.

Alle deelnemers zullen zes klinische vignetten evalueren tijdens één begeleide sessie van ongeveer 75 minuten. Drie vignetten bevatten opzettelijk geïntroduceerde klinische redeneerfouten in de LLM-aanbevelingen, terwijl drie correcte aanbevelingen bevatten. De vignetten worden in willekeurige volgorde gepresenteerd om patroonherkenning te voorkomen.

Deelnemers in de controlearm evalueren klinische vignetten met LLM-diagnostische aanbevelingen gegenereerd door ChatGPT, gepresenteerd in standaard, neutraal tekstformaat zonder aanvullende contextuele informatie. Deelnemers in de interventiearm evalueren dezelfde vignetten samen met een gedragsinterventie ('nudge'). Deze interventie bestaat uit twee gesynchroniseerde cognitieve signalen: (1) een ankersignaal dat de basislijn diagnostische nauwkeurigheid van ChatGPT op standaard medische datasets bovenaan het interfacepaneel toont, wat expliciet de verwachtingen verankert aan de feilbaarheid van het model, en (2) een selectieve aandachtssignaal dat de LLM-aanbeveling toont naast een kleurgecodeerd betrouwbaarheidssignaal gegenereerd via een ensemblebeoordeling: drie onafhankelijke state-of-the-art LLM's (Claude Sonnet 4.5, Gemini 2.5 Pro Thinking en GPT-5.1) geven elk betrouwbaarheidsbeoordelingen voor de aanbeveling, en het gemiddelde betrouwbaarheidsniveau bepaalt de signaalkleur om miscalibratie van een enkel model te beperken.

De kleurgecodeerde betrouwbaarheidssignalen zijn gecategoriseerd in drie verschillende niveaus op basis van het gemiddelde betrouwbaarheidsniveau van het ensemble ten opzichte van de basislijn diagnostische nauwkeurigheid. Rode signalen worden geactiveerd wanneer het gemiddelde betrouwbaarheidsniveau onder de vastgestelde basislijnnauwkeurigheid van ChatGPT valt, wat expliciet gevallen met hoge onzekerheid markeert die verhoogde kritische toetsing vereisen. Oranje signalen geven aan dat hoewel het gemiddelde betrouwbaarheidsniveau de basislijn gemiddelde overschrijdt, het onder de 100% blijft, wat de noodzaak voor voortdurende klinische waakzaamheid en het vermijden van zelfvoldaanheid signaleert. Ten slotte zijn groene signalen gereserveerd voor gevallen met 100% ensembleconsensus; echter, zelfs bij dit vertrouwensniveau blijven standaard AI-veiligheidswaarschuwingen aanwezig om overmatige afhankelijkheid van de output van het systeem te voorkomen.

Deelnemers krijgen zes klinische vignetten gepresenteerd die specifiek zijn ontworpen om automatiseringbias te meten, afkomstig en aangepast van echte casussen die een reeks diagnostische moeilijkheidsgraden en veelvoorkomende medische specialismen vertegenwoordigen. Elk vignet volgt een gestandaardiseerd formaat inclusief hoofdklacht, anamnese, relevante voorgeschiedenis (medisch/sociaal/familie), lichamelijk onderzoek bevindingen en initiële laboratoriumresultaten.

De primaire uitkomstmaat is de Diagnostisch Redeneren Prestatiescore, een samengesteld percentagescore gebaseerd op een gestructureerde rubric die evalueert: kwaliteit van differentiële diagnoses, ondersteunende bevindingen, tegenstrijdige bevindingen, nauwkeurigheid van de uiteindelijke diagnose en geschiktheid van vervolgstappen. Secundaire uitkomstmaten omvatten nauwkeurigheid van de topkeuze diagnose (onjuist, gedeeltelijk juist of juist). Alle antwoorden worden geëvalueerd door geblindeerde beoordelaars met behulp van de beoordelingsrubric.

Studietype

Ingrijpend

Inschrijving (Werkelijk)

72

Fase

  • Niet toepasbaar

Contacten en locaties

In dit gedeelte vindt u de contactgegevens van degenen die het onderzoek uitvoeren en informatie over waar dit onderzoek wordt uitgevoerd.

Studie Locaties

    • Punjab Province
      • Lahore, Punjab Province, Pakistan, 54792
        • Lahore University of Management Sciences

Deelname Criteria

Onderzoekers zoeken naar mensen die aan een bepaalde beschrijving voldoen, de zogenaamde geschiktheidscriteria. Enkele voorbeelden van deze criteria zijn iemands algemene gezondheidstoestand of eerdere behandelingen.

Geschiktheidscriteria

Leeftijden die in aanmerking komen voor studie

  • Kind
  • Volwassen
  • Oudere volwassene

Accepteert gezonde vrijwilligers

Ja

Beschrijving

Insluitingscriteria:

  • Volledig of voorwaardelijk geregistreerde medisch beoefenaars bij de Pakistan Medical and Dental Council (PMDC).
  • Voltooid Bachelor of Medicine, Bachelor of Surgery (MBBS) examen. Het equivalente diploma van MBBS in de VS en Canada is de Doctor of Medicine (MD).
  • Deelnemers moeten een gestructureerd trainingsprogramma over het gebruik van ChatGPT (of een vergelijkbaar groot taalmodel) hebben voltooid, met in totaal minstens 10 uur instructie. Het programma moet praktische oefening bevatten met betrekking tot de belangrijkste aspecten van LLM's, specifiek prompt engineering en inhoudsevaluatie.

Uitsluitingscriteria:

  • Alle andere geregistreerde medisch beoefenaars (volledig of voorwaardelijk) bij de PMDC (bijvoorbeeld professionals met een Bachelor of Dental Surgery of BDS).

Studie plan

Dit gedeelte bevat details van het studieplan, inclusief hoe de studie is opgezet en wat de studie meet.

Hoe is de studie opgezet?

Ontwerpdetails

  • Primair doel: Diagnostisch
  • Toewijzing: Gerandomiseerd
  • Interventioneel model: Parallelle opdracht
  • Masker: Enkel

Wapens en interventies

Deelnemersgroep / Arm
Interventie / Behandeling
Actieve vergelijker: ChatGPT-aanbevelingen naast een gedragsduwtje
Deelnemers zullen zes klinische vignetten evalueren. Tijdens het onderzoek hebben zij toegang tot klinische aanbevelingen van een specifiek, commercieel beschikbaar LLM (ChatGPT) naast conventionele diagnostische bronnen. LLM-aanbevelingen voor drie vignetten zullen opzettelijk foutieve diagnostische informatie bevatten en voor drie vignetten zullen ze nauwkeurige aanbevelingen bevatten. De casussen worden in willekeurige volgorde gepresenteerd. Deelnemers in deze groep ontvangen een gedragsstimulans ingebed in de LLM-aanbevelingeninterface die twee gesynchroniseerde cognitieve signalen toont wanneer het LLM-paneel wordt uitgeklapt: (1) een ankeringssignaal dat ChatGPT's basislijn diagnostische nauwkeurigheid op standaard medische datasets bovenaan het paneel weergeeft om realistische verwachtingen te stellen, gevolgd door een cuesignaal direct daaronder, dat de LLM-aanbevelingen toont naast een casusspecifiek kleurgecodeerd vertrouwenssignaal.
Deelnemers in de behandelgroep ontvangen een gedragsinterventie ingebed in de LLM-aanbevelingeninterface die twee gesynchroniseerde cognitieve signalen presenteert wanneer het LLM-paneel wordt uitgevouwen: (1) een ankersignaal dat de basislijn diagnostische nauwkeurigheid van ChatGPT op standaard medische datasets bovenaan het paneel weergeeft om realistische verwachtingen te scheppen voordat de specifieke aanbeveling wordt bekeken, en (2) een selectief aandachtssignaal direct daaronder, dat de LLM-aanbeveling toont naast een casus-specifiek en kleurgecodeerd vertrouwenssignaal. Dit signaal wordt gecategoriseerd als rood wanneer het gemiddelde ensemblevertrouwen onder de vastgestelde basislijnnauwkeurigheid valt, waarmee gevallen met hoge onzekerheid worden gemarkeerd die kritische evaluatie vereisen; oranje wanneer het vertrouwen de basislijn bereikt of overschrijdt maar onder de 100% blijft, bedoeld om zelfgenoegzaamheid te voorkomen en actieve klinische beoordeling te behouden; en groen voor een 100% ensembleconsensus, hoewel standaard waarschuwingsboodschappen nog steeds van toepassing zijn om te beschermen tegen.
Geen tussenkomst: ChatGPT-aanbevelingen zonder een gedragsduwtje
Deelnemers zullen zes klinische vignetten evalueren. Tijdens de proef hebben zij toegang tot klinische aanbevelingen van een specifiek, commercieel beschikbaar LLM (ChatGPT) naast conventionele diagnostische bronnen. LLM-aanbevelingen voor drie vignetten bevatten opzettelijk foutieve diagnostische informatie. De casussen worden in willekeurige volgorde gepresenteerd. Deelnemers in deze arm ontvangen geen gedragsmatige duwtje in de rug.

Wat meet het onderzoek?

Primaire uitkomstmaten

Uitkomstmaat
Maatregel Beschrijving
Tijdsspanne
Diagnostische redeneernauwkeurigheidsscore
Tijdsspanne: Beoordeeld op een enkel tijdstip voor elk geval, tijdens de geplande diagnostische redeneersessie, die plaatsvindt tussen 0-5 dagen na inschrijving van de deelnemer.
Het primaire resultaat zal het percentage correcte antwoorden voor elke casus zijn, variërend van 0 tot 100%, waarbij hogere scores wijzen op betere diagnostische prestaties. Voor elke casus zullen deelnemers gevraagd worden om hun drie belangrijkste diagnoses, bevindingen die elke diagnose ondersteunen en bevindingen die elke diagnose tegenspreken. Voor elke plausibele diagnose ontvangen deelnemers 1 punt. Bevindingen die de diagnose ondersteunen en bevindingen die de diagnose tegenspreken, zullen ook worden beoordeeld op basis van correctheid, met 1 punt voor elk correct antwoord. Vervolgens zullen deelnemers gevraagd worden om hun belangrijkste diagnose te noemen waarvan zij denken dat deze het meest waarschijnlijk is, waarbij ze 9 punten verdienen voor een redelijk antwoord en 18 punten voor het meest nauwkeurige antwoord. Ten slotte zullen deelnemers gevraagd worden om maximaal 3 vervolgstappen te noemen om de patiënt verder te evalueren, waarbij 0,5 punt wordt toegekend voor een gedeeltelijk correct antwoord en 1 punt voor een volledig correct antwoord. Het primaire resultaat zal op casusniveau worden vergeleken tussen de gerandomiseerde groepen.
Beoordeeld op een enkel tijdstip voor elk geval, tijdens de geplande diagnostische redeneersessie, die plaatsvindt tussen 0-5 dagen na inschrijving van de deelnemer.

Secundaire uitkomstmaten

Uitkomstmaat
Maatregel Beschrijving
Tijdsspanne
Topkeuze diagnose nauwkeurigheidsscore
Tijdsspanne: Beoordeeld op één enkel tijdstip voor elke casus, tijdens de geplande diagnostische redeneersessie, die plaatsvindt tussen 0-5 dagen na inschrijving van de deelnemer.
Het secundaire eindpunt meet de prestaties van de deelnemers bij het identificeren van de meest waarschijnlijke diagnose voor elke klinische vignet. Na evaluatie van elk geval selecteren deelnemers hun enige meest waarschijnlijke diagnose, die wordt gescoord op een vooraf bepaalde Drie-Traps Diagnostische Nauwkeurigheidsschaal: 18 punten voor de meest accurate diagnose, 9 punten voor een klinisch redelijk alternatief, en 0 punten voor een onjuiste diagnose. Voor elke deelnemer wordt een Topkeuze Diagnose Nauwkeurigheidsscore berekend als (totaal verdiende punten ÷ maximaal mogelijke punten) × 100, resulterend in een bereik van 0-100 % waarbij hogere scores een grotere diagnostische nauwkeurigheid aangeven. Dit percentagescore wordt op casusniveau vergeleken tussen gerandomiseerde groepen om de impact van automatiseringbias op diagnostische besluitvorming te kwantificeren.
Beoordeeld op één enkel tijdstip voor elke casus, tijdens de geplande diagnostische redeneersessie, die plaatsvindt tussen 0-5 dagen na inschrijving van de deelnemer.

Medewerkers en onderzoekers

Hier vindt u mensen en organisaties die betrokken zijn bij dit onderzoek.

Onderzoekers

  • Hoofdonderzoeker: Muhammad Asadullah Khawaja, MBBS, King Edward Medical University
  • Hoofdonderzoeker: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences (LUMS)
  • Hoofdonderzoeker: Ali Zafar Sheikh, MBBS, Lahore General Hospital
  • Hoofdonderzoeker: Muhammad Junaid Akhtar, MBBS, Children's Hospital, Lahore
  • Hoofdonderzoeker: Muhammad Hamad Alizai, PhD, Lahore University of Management Sciences (LUMS)

Studie record data

Deze datums volgen de voortgang van het onderzoeksdossier en de samenvatting van de ingediende resultaten bij ClinicalTrials.gov. Studieverslagen en gerapporteerde resultaten worden beoordeeld door de National Library of Medicine (NLM) om er zeker van te zijn dat ze voldoen aan specifieke kwaliteitscontrolenormen voordat ze op de openbare website worden geplaatst.

Bestudeer belangrijke data

Studie start (Werkelijk)

17 januari 2026

Primaire voltooiing (Werkelijk)

25 mei 2026

Studie voltooiing (Werkelijk)

26 mei 2026

Studieregistratiedata

Eerst ingediend

26 december 2025

Eerst ingediend dat voldeed aan de QC-criteria

26 december 2025

Eerst geplaatst (Werkelijk)

9 januari 2026

Updates van studierecords

Laatste update geplaatst (Werkelijk)

25 juni 2026

Laatste update ingediend die voldeed aan QC-criteria

24 juni 2026

Laatst geverifieerd

1 juni 2026

Meer informatie

Termen gerelateerd aan deze studie

Plan Individuele Deelnemersgegevens (IPD)

Bent u van plan om gegevens van individuele deelnemers (IPD) te delen?

NEE

Informatie over medicijnen en apparaten, studiedocumenten

Bestudeert een door de Amerikaanse FDA gereguleerd geneesmiddel

Nee

Bestudeert een door de Amerikaanse FDA gereguleerd apparaatproduct

Nee

Deze informatie is zonder wijzigingen rechtstreeks van de website clinicaltrials.gov gehaald. Als u verzoeken heeft om uw onderzoeksgegevens te wijzigen, te verwijderen of bij te werken, neem dan contact op met register@clinicaltrials.gov. Zodra er een wijziging wordt doorgevoerd op clinicaltrials.gov, wordt deze ook automatisch bijgewerkt op onze website .

Abonneren