Tämä sivu käännettiin automaattisesti, eikä käännösten tarkkuutta voida taata. Katso englanninkielinen versio lähdetekstiä varten.

Automaatioväritteen lieventäminen lääkärin-LLM-diagnostisessa päättelyssä käyttäen käyttäytymisen nudgeja

keskiviikko 24. kesäkuuta 2026 päivittänyt: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences

Automaatiovirheen vähentäminen lääkärin-LLM-diagnostisessa päättelyssä käyttäen käyttäytymiseen vaikuttavia työntöjä

Tämän satunnaistetun kontrolloidun kokeen tavoitteena on arvioida, voivatko käyttäytymiseen vaikuttavat kannustimet vähentää automaatiopuolueellisuutta, joka tarkoittaa automaattisen tuotoksen kriittitöntä hyväksymistä, lääkäreillä, jotka käyttävät suuria kielimalleja (LLM) kuten ChatGPT-5.1 kliiniseen päätöksentekoon.

Pääkysymys, johon se pyrkii vastaamaan, on: Vähentääkö kaksoismekanisminen käyttäytymiseen vaikuttava kannustininterventio (perustason tarkkuuden ankkurointi plus tapauskohtaiset värikoodatut luottamussignaalit) lääkäreiden kriittitöntä hyväksymistä virheellisistä LLM-suosituksista?

Tutkijat vertailevat lääkäreitä, jotka saavat LLM-suosituksia yhdessä käyttäytymiseen vaikuttavan kannustimen kanssa, niihin, jotka saavat LLM-suosituksia ilman kannustinta, arvioidakseen, vähentääkö kannustin automaatiopuolueellisuutta.

Osallistujat:

  • Arvioivat kuusi kliinistä tapauskuvausta, joihin liittyy LLM-generoituja suosituksia (puolessa on tarkoituksellisia, kliinisesti merkittäviä virheitä).
  • Kontrolliryhmä: Pääsevät katsomaan LLM-suosituksia standardimuodossa ilman kannustinta.
  • Hoitoryhmä: Pääsevät katsomaan ChatGPT:n diagnoosien tarkkuutta standardeissa lääketieteellisissä tietokannoissa alkuperäisenä ankkurina, sitten saavat värikoodatut luottamussignaalit jokaisen suosituksen yhteydessä (esim. punainen matalalle luottamukselle).
  • Heidän vastauksensa arvioidaan sokeilla arvioijilla asiantuntijoiden kehittämällä arviointikaaviolla havaitsemaan virheellisen tiedon kriittitön hyväksyminen.

Tutkimuksen yleiskatsaus

Yksityiskohtainen kuvaus

Automaatiopuolueellisuus edustaa kriittistä haastetta nykyaikaisessa kliinisessä käytännössä, erityisesti kun tekoälytyökalut sulautuvat yhä enemmän terveydenhuollon työnkulkujen osaksi. Tämä kognitiivinen ilmiö kuvaa kliinikkojen taipumusta suosia automatisoitujen päätöksentekojärjestelmien ehdotuksia, vaikka nämä ehdotukset olisivatkin virheellisiä. Kun suuret kielimallit (LLM) kuten ChatGPT-5.1 saavat jalansijaa lääketieteellisissä ympäristöissä, niiden potentiaali vähentää virheitä ja parantaa tehokkuutta on punnittava merkittävää huolta vastaan: nämä mallit puuttuvat tiukasta lääketieteellisestä validoinnista ja saattavat vahvistaa olemassa olevia kognitiivisia puolueellisuuksia virheellisten tai harhaanjohtavien suositusten kautta.

Automaatiopuolueellisuuden esiintyminen lääketieteellisissä konteksteissa heijastaa monimutkaista ympäristöllisten ja psykologisten tekijöiden vuorovaikutusta. Aikarajoitukset suuren volyymin kliinisissä ympäristöissä luovat paineen hyväksyä tekoälyn tuottamia suosituksia ilman riittävää tarkastelua. Taloudelliset kannustimet, jotka asettavat tehokkuuden perusteellisuuden edelle, saattavat entisestään estää kriittistä arviointia, joka on välttämätöntä hyvälle kliiniselle harkinnalle. Kognitiivinen väsymys pitkien vuorojen aikana heikentää lääkäreiden kykyä jatkuvaan analyyttiseen ajatteluun. Nämä paineet vuorovaikuttavat psykologisten mekanismien kanssa, mukaan lukien vastuun hajautuminen, yliitsevarmuus teknologisiin ratkaisuihin ja kognitiivinen kuormituksen siirto, luoden yhdessä olosuhteet, joissa tekoälyn tuottamien suositusten kriittimetön hyväksyminen todennäköisyyttä.

Tämä satunnaistettu kontrolloitu koe arvioi käyttäytymisnudge-intervention tehokkuutta, joka on suunniteltu lieventämään automaatiopuolueellisuutta lääkäreiden keskuudessa, jotka käyttävät LLM:ien tuottamia diagnostisia suosituksia. Ensisijainen tavoite on määrittää, parantaako tämä intervention diagnostisen päättelyn suorituskykyä arvioitaessa kliinisiä vinjettejä, jotka sisältävät tarkoituksellisesti viallisia LLM-suosituksia. Toissijaiset tavoitteet sisältävät arvioinnin siitä, vaikuttavatko lääkärin kokemustaso, sukupuoli ja aiempi LLM-kokemus intervention tehokkuuteen, sekä määrittämisen intervention erilaisen tehokkuuden vinjeteille eri luottamusmerkkien välillä.

Tämä tutkimus käyttää yksisokeaa, satunnaistettua kontrolloitua koetta kahdella rinnakkaisella haara. Osallistujat satunnaistetaan 1:1 joko intervention tai kontrollihaaraan. Poistaakseen muuttuvuuden, joka johtuu eroista kehottamistaitoissa, osallistujat eivät vuorovaikuta suoraan live-LLM-käyttöliittymän kanssa. Sen sijaan kaikki osallistujat käyttävät räätälöityä verkkoplattformia, joka näyttää kliinisiä vinjettejä esigeneroiduilla LLM-suosituksilla, varmistaen identtisen LLM-generoidun sisällön jokaiselle vinjetille.

Kaikki osallistujat arvioivat kuusi kliinistä vinjettiä yhden, valvotun istunnon aikana, joka kestää noin 75 minuuttia. Kolme vinjettiä sisältää tarkoituksellisesti tuotuja kliinisen päättelyn virheitä LLM-suosituksissa, kun taas kolme sisältää oikeita suosituksia. Vinjetit esitetään satunnaisessa järjestyksessä estääkseen kuviotunnistuksen.

Kontrollihaaran osallistujat arvioivat kliinisiä vinjettejä ChatGPT:n tuottamien LLM-diagnostisten suositusten kanssa, jotka esitetään standardissa, neutraalissa tekstimuodossa ilman lisäkontekstuaalista tietoa. Interventionhaaran osallistujat arvioivat samoja vinjettejä käyttäytymisnudge-intervention kanssa. Tämä intervention koostuu kahdesta synkronoidusta kognitiivisesta vihjeestä: (1) ankkurointivihje, joka näyttää ChatGPT:n perusdiagnostisen tarkkuuden standardeilla lääketieteellisillä tietokannoilla käyttöliittymäpaneelin yläosassa, ankkuroimalla eksplisiittisesti odotukset mallin erehtyvyyteen, ja (2) valikoivan huomion vihje, joka näyttää LLM-suosituksen värikoodatun luottamussignaalin rinnalla, joka generoidaan kokonaisarvioinnin kautta: kolme itsenäistä huippuluokan LLM:ää (Claude Sonnet 4.5, Gemini 2.5 Pro Thinking ja GPT-5.1) antavat kukin luottamusarvioinnin suositukselle, ja keskiarvoluottamus määrittää signaalin värin lieventääkseen yksittäismallin virhekalibraatiota.

Värikoodatut luottamussignaalit luokitellaan kolmeen eri tasoon perustuen kokonaisarvion keskiarvon luottamukseen suhteessa perusdiagnostiseen tarkkuuteen. Punaiset signaalit laukeavat, kun keskiarvon luottamus laskee ChatGPT:n vahvistetun perustarkkuuden alapuolelle, merkiten eksplisiittisesti korkean epävarmuuden tapauksia, jotka vaativat lisääntyneen kriittisen tarkastelun. Oranssit signaalit osoittavat, että vaikka keskiarvon luottamus ylittää peruskeskiarvon, se pysyy alle 100 %, signaloiden jatkuvan kliinisen valppauden tarpeen ja itsetyytyväisyyden välttämisen. Lopuksi vihreät signaalit varataan tapauksille, joissa on 100 % kokonaisarvion yksimielisyys; kuitenkin, jopa tällä luottamustasolla, standardit tekoälyn turvallisuusvaroitukset pysyvät läsnä suojautuakseen järjestelmän tuotoksen ylivelvoittamiselta.

Osallistujille esitetään kuusi kliinistä vinjettiä, jotka on erityisesti suunniteltu mittaamaan automaatiopuolueellisuutta, peräisin ja muokattu todellisista tapauksista, jotka edustavat erilaista diagnostista vaikeutta ja yleisiä lääketieteellisiä erikoisaloja. Jokainen vinjetti noudattaa standardoitua muotoa, mukaan lukien päävalitus, nykyisen sairauden historia, relevantti aiempi lääketieteellinen/sosiaalinen/perhehistoria, fyysiset tutkimustulokset ja alustavat laboratoriotulokset.

Ensisijainen lopputulos on Diagnostisen Päättelyn Suorituskykypistemäärä, yhdistetty prosenttiosuus, joka perustuu strukturoituun arviointikriteeriin, joka arvioi: erotusdiagnoosien laatua, tukevia havaintoja, vastustavia havaintoja, lopullisen diagnoosin tarkkuutta ja seuraavien vaiheiden sopivuutta. Toissijaiset lopputulokset sisältävät ykkösvalinnan diagnoosin tarkkuuden (virheellinen, osittain oikea tai oikea). Kaikki vastaukset arvioidaan sokeilla arvioijilla käyttäen arviointikriteeriä.

Opintotyyppi

Interventio

Ilmoittautuminen (Todellinen)

72

Vaihe

  • Ei sovellettavissa

Yhteystiedot ja paikat

Tässä osiossa on tutkimuksen suorittajien yhteystiedot ja tiedot siitä, missä tämä tutkimus suoritetaan.

Opiskelupaikat

    • Punjab Province
      • Lahore, Punjab Province, Pakistan, 54792
        • Lahore University of Management Sciences

Osallistumiskriteerit

Tutkijat etsivät ihmisiä, jotka sopivat tiettyyn kuvaukseen, jota kutsutaan kelpoisuuskriteereiksi. Joitakin esimerkkejä näistä kriteereistä ovat henkilön yleinen terveydentila tai aiemmat hoidot.

Kelpoisuusvaatimukset

Opintokelpoiset iät

  • Lapsi
  • Aikuinen
  • Vanhempi Aikuinen

Hyväksyy terveitä vapaaehtoisia

Joo

Kuvaus

Ottamiskriteerit:

  • Pakistanin lääketieteellisen ja hammaslääketieteellisen neuvoston (PMDC) täysi- tai väliaikaisrekisteröidyt lääkärit.
  • Suoritettu Bachelor of Medicine, Bachelor of Surgery (MBBS) -tutkinto. Vastaava tutkinto MBBS:lle Yhdysvalloissa ja Kanadassa on Doctor of Medicine (MD).
  • Osallistujien on suoritettava jäsennelty koulutusohjelma ChatGPT:n (tai vastaavan suuren kielimallin) käytöstä, yhteensä vähintään 10 opetus­tuntia. Ohjelman on sisällettävä käytännön harjoituksia LLM:n keskeisiin näkökohtiin, erityisesti prompt-engineeringiin ja sisällön arviointiin.

Poissulkemiskriteerit:

  • Kaikki muut PMDC:n rekisteröidyt lääkärit (täysi- tai väliaikaisrekisteröidyt) (esim. ammattilaiset, joilla on Bachelor of Dental Surgery eli BDS).

Opintosuunnitelma

Tässä osiossa on tietoja tutkimussuunnitelmasta, mukaan lukien kuinka tutkimus on suunniteltu ja mitä tutkimuksella mitataan.

Miten tutkimus on suunniteltu?

Suunnittelun yksityiskohdat

  • Ensisijainen käyttötarkoitus: Diagnostiikka
  • Jako: Satunnaistettu
  • Inventiomalli: Rinnakkaistehtävä
  • Naamiointi: Yksittäinen

Aseet ja interventiot

Osallistujaryhmä / Arm
Interventio / Hoito
Active Comparator: ChatGPT-suositukset käyttäytymiseen vaikuttavan työnnön ohella
Osallistujat arvioivat kuusi kliinistä vinjettiä. Kokeen aikana heillä on pääsy kliinisiin suosituksiin tietystä kaupallisesti saatavilla olevasta LLM:stä (ChatGPT) perinteisten diagnostisten resurssien lisäksi. LLM:n suositukset kolmelle vinjetille sisältävät tarkoituksellisesti virheellistä diagnostista tietoa ja kolmelle vinjetille ne sisältävät tarkkoja suosituksia. Tapaukset esitetään satunnaisessa järjestyksessä. Tämän ryhmän osallistujat saavat käyttäytymiseen vaikuttavan pienen kannusteen, joka on upotettu LLM-suositusten käyttöliittymään ja joka esittää kaksi synkronoitua kognitiivista vihjettä, kun LLM-paneeli avataan: (1) ankkurointivihje, joka näyttää ChatGPT:n perustason diagnoosien tarkkuuden standardeilla lääketieteen tietoaineistoilla paneelin yläosassa asettaakseen realistiset odotukset ennen vihjeen interventiota, joka sijaitsee välittömästi alapuolella ja näyttää LLM-suositukset yhdessä tapauskohtaisen värikoodatun luottamussignaalin kanssa.
Hoidon ryhmän osallistujat saavat käyttäytymiseen vaikuttavan interventioon, joka on upotettu LLM-suositusten käyttöliittymään. Tämä esittää kaksi synkronoitua kognitiivista vihjettä, kun LLM-paneeli avataan: (1) ankkuroiva vihje, joka näyttää ChatGPT:n perustason diagnostisen tarkkuuden standardeilla lääketieteellisillä tietoaineistoilla paneelin yläosassa asettaakseen realistiset odotukset ennen tietyn suosituksen katsomista, ja (2) valikoiva huomionvihje, joka sijaitsee välittömästi alapuolella ja näyttää LLM-suosituksen rinnakkain tapauskohtaisen ja värikoodatun luottamussignaalin kanssa. Tämä signaali luokitellaan punaiseksi, kun keskiarvoinen kokonaisluottamus putoaa alle vahvistetun perustasotarkkuuden, mikä osoittaa korkean epävarmuuden tapauksia, jotka vaativat kriittistä arviointia; oranssiksi, kun luottamus vastaa tai ylittää perustason, mutta pysyy alle 100 %, tarkoituksena estää tyytyväisyys ja ylläpitää aktiivista kliinistä tarkastelua; ja vihreäksi 100 %:n kokonaiskonsensukselle, vaikka tavanomaiset varoitusmerkinnät pätevät edelleen suojautuakseen.
Ei väliintuloa: ChatGPT-suositukset ilman käyttäytymisohjausta
Osallistujat arvioivat kuusi kliinistä vihjettä. Kokeen aikana heillä on pääsy kliinisiin suosituksiin tietystä, kaupallisesti saatavilla olevasta LLM:stä (ChatGPT) perinteisten diagnostisten resurssien lisäksi. LLM:n suositukset kolmelle vihjeelle sisältävät tahallisesti virheellistä diagnostista tietoa. Tapaukset esitetään satunnaisessa järjestyksessä. Tämän haaran osallistujat eivät saa mitään käyttäytymiseen vaikuttavaa työntöä.

Mitä tutkimuksessa mitataan?

Ensisijaiset tulostoimenpiteet

Tulosmittaus
Toimenpiteen kuvaus
Aikaikkuna
Diagnostisen päättelyn tarkkuuspisteet
Aikaikkuna: Arvioitu kussakin tapauksessa yhdellä ajanhetkellä, aikataulutetun diagnostisen päättelyarviointitapaamisen aikana, joka järjestetään 0–5 päivän kuluessa osallistujan rekrytoinnista.
Ensisijainen lopputulos on kunkin tapauksen prosentuaalinen oikeellisuus asteikolla 0–100 %, jossa korkeammat pisteet osoittavat parempaa diagnostiikkaa. Jokaisesta tapauksesta osallistujia pyydetään nimeämään kolme parasta diagnoosiaan, löydökset, jotka tukevat kukin diagnoosia, ja löydökset, jotka vastustavat kukin diagnoosia. Jokaisesta uskottavasta diagnoosista osallistuja saa 1 pisteen. Diagnoosia tukevat löydökset ja diagnoosia vastustavat löydökset arvostellaan myös oikeellisuuden perusteella, 1 piste kustakin oikeasta vastauksesta. Osallistujia pyydetään sitten nimeämään paras diagnoosinsa, jonka he uskovat olevan todennäköisin, ja he saavat 9 pistettä kohtuullisesta vastauksesta ja 18 pistettä tarkimmasta vastauksesta. Lopuksi osallistujia pyydetään nimeämään enintään 3 seuraavaa vaihetta potilaan jatkoarviointia varten, joista osittain oikeasta vastauksesta saa 0,5 pistettä ja täysin oikeasta vastauksesta 1 pisteen. Ensisijainen lopputulos verrataan tapauskohtaisesti satunnaistettujen ryhmien välillä.
Arvioitu kussakin tapauksessa yhdellä ajanhetkellä, aikataulutetun diagnostisen päättelyarviointitapaamisen aikana, joka järjestetään 0–5 päivän kuluessa osallistujan rekrytoinnista.

Toissijaiset tulostoimenpiteet

Tulosmittaus
Toimenpiteen kuvaus
Aikaikkuna
Parhaan vaihtoehdon diagnoosintarkkuuspistemäärä
Aikaikkuna: Arvioitu kerrallaan kullekin tapaukselle suunnitellun diagnostisen päättelyn arviointitilaisuuden aikana, joka järjestetään 0–5 päivän kuluessa osallistujan rekisteröinnistä.
Toissijainen lopputulos mittaa osallistujien suorituskykyä tunnistaa todennäköisin diagnoosi kullekin kliiniselle tapaukselle. Jokaisen tapauksen arvioinnin jälkeen osallistujat valitsevat yhden todennäköisimmän diagnoosinsa, joka arvostellaan ennalta määritellyllä kolmiportaisella diagnoosintarkkuusasteikolla: 18 pistettä tarkimmasta diagnoosista, 9 pistettä kliinisesti järkevästä vaihtoehdosta ja 0 pistettä virheellisestä diagnoosista. Jokaiselle osallistujalle lasketaan Ensisijaisen Valinnan Diagnoosintarkkuuspisteet kaavalla (ansaitut pisteet ÷ mahdolliset maksimipisteet) × 100, mikä tuottaa 0-100 % alueen, jossa korkeammat pisteet osoittavat parempaa diagnoosintarkkuutta. Tätä prosenttiosuutta verrataan tapauskohtaisesti satunnaistettujen ryhmien välillä kvantifioimaan automaatiopuolueisuuden vaikutusta diagnoosipäätöksentekoon.
Arvioitu kerrallaan kullekin tapaukselle suunnitellun diagnostisen päättelyn arviointitilaisuuden aikana, joka järjestetään 0–5 päivän kuluessa osallistujan rekisteröinnistä.

Yhteistyökumppanit ja tutkijat

Täältä löydät tähän tutkimukseen osallistuvat ihmiset ja organisaatiot.

Tutkijat

  • Päätutkija: Muhammad Asadullah Khawaja, MBBS, King Edward Medical University
  • Päätutkija: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences (LUMS)
  • Päätutkija: Ali Zafar Sheikh, MBBS, Lahore General Hospital
  • Päätutkija: Muhammad Junaid Akhtar, MBBS, Children's Hospital, Lahore
  • Päätutkija: Muhammad Hamad Alizai, PhD, Lahore University of Management Sciences (LUMS)

Opintojen ennätyspäivät

Nämä päivämäärät seuraavat ClinicalTrials.gov-sivustolle lähetettyjen tutkimustietueiden ja yhteenvetojen edistymistä. National Library of Medicine (NLM) tarkistaa tutkimustiedot ja raportoidut tulokset varmistaakseen, että ne täyttävät tietyt laadunvalvontastandardit, ennen kuin ne julkaistaan ​​julkisella verkkosivustolla.

Opi tärkeimmät päivämäärät

Opiskelun aloitus (Todellinen)

Lauantai 17. tammikuuta 2026

Ensisijainen valmistuminen (Todellinen)

Maanantai 25. toukokuuta 2026

Opintojen valmistuminen (Todellinen)

Tiistai 26. toukokuuta 2026

Opintoihin ilmoittautumispäivät

Ensimmäinen lähetetty

Perjantai 26. joulukuuta 2025

Ensimmäinen toimitettu, joka täytti QC-kriteerit

Perjantai 26. joulukuuta 2025

Ensimmäinen Lähetetty (Todellinen)

Perjantai 9. tammikuuta 2026

Tutkimustietojen päivitykset

Viimeisin päivitys julkaistu (Todellinen)

Torstai 25. kesäkuuta 2026

Viimeisin lähetetty päivitys, joka täytti QC-kriteerit

Keskiviikko 24. kesäkuuta 2026

Viimeksi vahvistettu

Maanantai 1. kesäkuuta 2026

Lisää tietoa

Tähän tutkimukseen liittyvät termit

Yksittäisten osallistujien tietojen suunnitelma (IPD)

Aiotko jakaa yksittäisten osallistujien tietoja (IPD)?

EI

Lääke- ja laitetiedot, tutkimusasiakirjat

Tutkii yhdysvaltalaista FDA sääntelemää lääkevalmistetta

Ei

Tutkii yhdysvaltalaista FDA sääntelemää laitetuotetta

Ei

Nämä tiedot haettiin suoraan verkkosivustolta clinicaltrials.gov ilman muutoksia. Jos sinulla on pyyntöjä muuttaa, poistaa tai päivittää tutkimustietojasi, ota yhteyttä register@clinicaltrials.gov. Heti kun muutos on otettu käyttöön osoitteessa clinicaltrials.gov, se päivitetään automaattisesti myös verkkosivustollemme .

Tilaa