- ICH GCP
- US Clinical Trials Registry
- Klinisk utprøving NCT06911645
Diagnostisk resonnement med tilpasset GPT-4-modell
Evaluering av ytelsen til LLMS og klinikere i komplekse diagnostiske tilfeller: en randomisert kontrollert studie
Studieoversikt
Status
Forhold
Detaljert beskrivelse
Kunstig intelligens (AI) teknologier, spesielt avanserte store språkmodeller som Openais ChatGPT, har potensial til å forbedre medisinsk beslutningstaking. Mens ChatGPT-4 ikke var spesielt designet for medisinske applikasjoner, har det vist løfte i forskjellige helsetjenester sammenhenger, inkludert medisinsk notatskriving, adressering av pasienthenvendelser og tilrettelegging for medisinske konsultasjoner. Imidlertid er dens innvirkning på klinikernes diagnostiske resonnement stort sett ukjent.
Klinisk resonnement er en kompleks prosess som involverer mønstergjenkjenning, kunnskapsapplikasjon og sannsynlig resonnement. Å integrere AI-verktøy som ChatGPT-4 i legearbeidsflyter kan bidra til å redusere klinikerens arbeidsmengde og redusere sannsynligheten for tapte diagnoser. Imidlertid ble ChatGPT-4 verken utviklet eller validert for diagnostisk resonnement, og det kan gi misvisende informasjon, inkludert plausible, men uriktige konklusjoner som kan misguide klinikere. Hvis det ikke brukes på riktig måte, kan det ikke kunne forbedre seg-og til og med kan hindre-klinisk beslutningstaking. Derfor er det viktig å studere hvordan klinikere bruker store språkmodeller for å støtte klinisk resonnement før de integrerer dem i rutinemessig pasientbehandling.
Denne studien vil undersøke hvordan øyeblikkelig tilgang til en tilpasset versjon av ChatGPT-4 påvirker ytelsen på saksbaserte diagnostiske resonnementoppgaver, sammenlignet med en trinnvis tilnærming. I den trinnvise tilnærmingen vil deltakerne først bruke tradisjonelle diagnostiske beslutningsstøtteverktøy for å støtte saken deres resonnement før de samhandler med en tilpasset chatGPT-4-modell, på hvilket tidspunkt de vil ha muligheten til å revidere de første svarene.
Deltakerne vil bli randomisert til forskjellige studiearmer og vil svare på diagnostiske tilfeller ved å gi tre differensialdiagnoser, sammen med støtte og motstridende funn for hver. De vil også identifisere toppdiagnosen og foreslå neste diagnostiske trinn. Uavhengige anmeldere, blendet for behandlingsoppgave, vil evaluere svarene sine.
Studietype
Registrering (Faktiske)
Fase
- Ikke aktuelt
Kontakter og plasseringer
Studiesteder
-
-
California
-
Palo Alto, California, Forente stater, 94305
- Stanford University
-
-
Deltakelseskriterier
Kvalifikasjonskriterier
Alder som er kvalifisert for studier
- Barn
- Voksen
- Eldre voksen
Tar imot friske frivillige
Beskrivelse
Inkluderingskriterier:
- Deltakerne må være lisensierte leger og har fullført minst etterutdanningsår 1 (PGY1) av medisinsk opplæring.
- Opplæring i indremedisin, familiemedisin eller akuttmedisin.
Eksklusjonskriterier:
- Ikke for tiden praktiserer klinisk.
- Deltok i en av våre tidligere studier som brukte de samme seks diagnostiske tilfellene.
Studieplan
Hvordan er studiet utformet?
Designdetaljer
- Primært formål: Diagnostisk
- Tildeling: Randomisert
- Intervensjonsmodell: Parallell tildeling
- Masking: Enkelt
Våpen og intervensjoner
Deltakergruppe / Arm |
Intervensjon / Behandling |
|---|---|
|
Aktiv komparator: Umiddelbar tilgang til tilpasset versjon av GPT-4
Gruppe vil bli oppfordret til å umiddelbart bruke en tilpasset versjon av GPT-4.
|
Gruppe får øyeblikkelig tilgang til en tilpasset versjon av GPT-4 for å støtte deres diagnostiske resonnement for hvert tilfelle.
|
|
Aktiv komparator: Konvensjonelle ressurser først, deretter gitt tilgang til tilpasset versjon av GPT-4.
Gruppe vil bli oppfordret til først å bruke alle ressurser de ønsker i tillegg til store språkmodeller (Uptodate, PubMed, Google, osv.) Og vil deretter få tilgang til en tilpasset versjon av GPT-4.
|
Gruppe oppfordres først til å resonnere gjennom diagnostiske tilfeller med støtte fra konvensjonelle ressurser.
Etter at de har sendt inn en sak, får de deretter tilgang til en tilpasset versjon av GPT-4 og har muligheten til å endre de første svarene.
|
Hva måler studien?
Primære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
Diagnostisk resonnement
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
Det primære utfallet vil være prosentandelen av riktige svar per sak (område: 0 til 100).
For hvert tilfelle vil deltakerne bli bedt om å gi sine tre beste differensialdiagnoser, sammen med støtte og motstridende funn for hver.
De vil motta 1 poeng for hver plausibel diagnose.
Støttende og motstridende funn vil bli gradert basert på korrekthet, med 1 poeng for en delvis korrekt respons og 2 poeng for en helt riktig respons.
Deltakerne vil deretter velge sin toppdiagnose, og tjene 1 poeng for et rimelig valg og 2 poeng for den mest nøyaktige diagnosen.
Til slutt vil de liste opp til tre neste trinn for videre pasientevaluering, med 1 poeng tildelt for en delvis korrekt respons og 2 poeng for en helt riktig respons.
Det primære utfallet vil bli analysert på saksnivå, og sammenligner ytelsen mellom de randomiserte studiegruppene.
|
Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
Sekundære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
Tidsbruk per sak
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
Etterforskerne vil sammenligne gjennomsnittlig tid (i minutter) deltakerne bruker på hvert tilfelle på tvers av de to studiearmene.
|
Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
|
Hurtig frekvens
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
Etterforskerne vil sammenligne hyppigheten av deltakerlys med den tilpassede GPT-4-modellen mellom de to studiegruppene.
|
Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
|
Sentiment
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
Etterforskerne vil sammenligne tonen og følelsen av deltakernes spørsmål til den tilpassede GPT-4-modellen på tvers av de to studiegruppene.
Etterforskerne vil lage et kvalitativt kodesystem for å kategorisere arten av deltakernes spørsmål.
|
Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
|
Deltakernes oppfatninger av AI i klinisk resonnement
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
Dette utfallet vil bli vurdert i både studiearmer og vil omfatte endringer i holdninger, selvtillit og vilje til å bruke AI -diagnostiske verktøy før og etter å ha blitt utsatt for det tilpassede verktøyet.
Vi vil vurdere antall deltakere som var åpne for å bruke AI for å hjelpe til med kompleks klinisk resonnement (pre- og post-quiz), hvis de likte å jobbe med AI-diagnostisk verktøy, hvis de følte at verktøyet ga en verdifull samarbeidsopplevelse for å resonnere, og hvis de ville bruke AI-diagnostisk verktøys anbefalinger økte deres tillit til deres differensi-diagnoser, og hvis de vil bruke AI AI AIs AI-diagnostisering økte med deres differensiodi-
Disse vil bli evaluert på en Likert -skala rangering fra sterkt uenig til sterkt enig.
|
Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
|
Tilpasset GPT-4s diagnostiske resonnement
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
De tilpassede GPT-4s 'uavhengige' diagnoser vil bli vurdert for nøyaktighet.
Utfallet vil være prosentandelen av riktige svar per sak (område: 0 til 100).
For hvert tilfelle leder Meta-Prompt den tilpassede GPT-4 til å gi de tre beste differensialdiagnosene, sammen med støtte og motstridende funn for hver, en endelig diagnose og neste trinn.
Den tilpassede GPT-4 vil motta 1 poeng for hver plausibel diagnose.
Støttende og motstridende funn vil bli gradert basert på korrekthet, med 1 poeng for en delvis korrekt respons og 2 poeng for en helt riktig respons.
Toppdiagnosen vil tjene 1 poeng for et rimelig valg og 2 poeng for den mest nøyaktige diagnosen.
Til slutt vil den oppgi opptil tre neste trinn for ytterligere pasientevaluering, med 1 poeng tildelt for en delvis korrekt respons og 2 poeng for en helt riktig respons.
Utfallet vil bli analysert på saksnivå, og sammenligner ytelse med de randomiserte studiegruppenes score.
|
Gjennom fullføring av studien, i gjennomsnitt 6 måneder
|
Samarbeidspartnere og etterforskere
Sponsor
Samarbeidspartnere
Etterforskere
- Hovedetterforsker: Jonathan H Chen, MD, PhD, Stanford University
Studierekorddatoer
Studer hoveddatoer
Studiestart (Faktiske)
Primær fullføring (Faktiske)
Studiet fullført (Faktiske)
Datoer for studieregistrering
Først innsendt
Først innsendt som oppfylte QC-kriteriene
Først lagt ut (Faktiske)
Oppdateringer av studieposter
Sist oppdatering lagt ut (Faktiske)
Siste oppdatering sendt inn som oppfylte QC-kriteriene
Sist bekreftet
Mer informasjon
Begreper knyttet til denne studien
Ytterligere relevante MeSH-vilkår
Andre studie-ID-numre
- 71319c
Plan for individuelle deltakerdata (IPD)
Planlegger du å dele individuelle deltakerdata (IPD)?
Legemiddel- og utstyrsinformasjon, studiedokumenter
Studerer et amerikansk FDA-regulert medikamentprodukt
Studerer et amerikansk FDA-regulert enhetsprodukt
produkt produsert i og eksportert fra USA
Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .