Denne siden ble automatisk oversatt og nøyaktigheten av oversettelsen er ikke garantert. Vennligst referer til engelsk versjon for en kildetekst.

Diagnostisk resonnement med tilpasset GPT-4-modell

27. mars 2025 oppdatert av: Jonathan Chen, Stanford University

Evaluering av ytelsen til LLMS og klinikere i komplekse diagnostiske tilfeller: en randomisert kontrollert studie

Denne studien vil vurdere virkningen av øyeblikkelig tilgang til en tilpasset versjon av GPT-4, en stor språkmodell, på ytelse i saksbaserte diagnostiske resonnementoppgaver. Spesifikt vil den sammenligne denne tilnærmingen med en totrinns prosess der deltakerne først bruker tradisjonelle diagnostiske beslutningsstøtteverktøy for å støtte deres diagnostiske resonnement før de får tilgang til den tilpassede GPT-4-modellen.

Studieoversikt

Detaljert beskrivelse

Kunstig intelligens (AI) teknologier, spesielt avanserte store språkmodeller som Openais ChatGPT, har potensial til å forbedre medisinsk beslutningstaking. Mens ChatGPT-4 ikke var spesielt designet for medisinske applikasjoner, har det vist løfte i forskjellige helsetjenester sammenhenger, inkludert medisinsk notatskriving, adressering av pasienthenvendelser og tilrettelegging for medisinske konsultasjoner. Imidlertid er dens innvirkning på klinikernes diagnostiske resonnement stort sett ukjent.

Klinisk resonnement er en kompleks prosess som involverer mønstergjenkjenning, kunnskapsapplikasjon og sannsynlig resonnement. Å integrere AI-verktøy som ChatGPT-4 i legearbeidsflyter kan bidra til å redusere klinikerens arbeidsmengde og redusere sannsynligheten for tapte diagnoser. Imidlertid ble ChatGPT-4 verken utviklet eller validert for diagnostisk resonnement, og det kan gi misvisende informasjon, inkludert plausible, men uriktige konklusjoner som kan misguide klinikere. Hvis det ikke brukes på riktig måte, kan det ikke kunne forbedre seg-og til og med kan hindre-klinisk beslutningstaking. Derfor er det viktig å studere hvordan klinikere bruker store språkmodeller for å støtte klinisk resonnement før de integrerer dem i rutinemessig pasientbehandling.

Denne studien vil undersøke hvordan øyeblikkelig tilgang til en tilpasset versjon av ChatGPT-4 påvirker ytelsen på saksbaserte diagnostiske resonnementoppgaver, sammenlignet med en trinnvis tilnærming. I den trinnvise tilnærmingen vil deltakerne først bruke tradisjonelle diagnostiske beslutningsstøtteverktøy for å støtte saken deres resonnement før de samhandler med en tilpasset chatGPT-4-modell, på hvilket tidspunkt de vil ha muligheten til å revidere de første svarene.

Deltakerne vil bli randomisert til forskjellige studiearmer og vil svare på diagnostiske tilfeller ved å gi tre differensialdiagnoser, sammen med støtte og motstridende funn for hver. De vil også identifisere toppdiagnosen og foreslå neste diagnostiske trinn. Uavhengige anmeldere, blendet for behandlingsoppgave, vil evaluere svarene sine.

Studietype

Intervensjonell

Registrering (Faktiske)

70

Fase

  • Ikke aktuelt

Kontakter og plasseringer

Denne delen inneholder kontaktinformasjon for de som utfører studien, og informasjon om hvor denne studien blir utført.

Studiesteder

    • California
      • Palo Alto, California, Forente stater, 94305
        • Stanford University

Deltakelseskriterier

Forskere ser etter personer som passer til en bestemt beskrivelse, kalt kvalifikasjonskriterier. Noen eksempler på disse kriteriene er en persons generelle helsetilstand eller tidligere behandlinger.

Kvalifikasjonskriterier

Alder som er kvalifisert for studier

  • Barn
  • Voksen
  • Eldre voksen

Tar imot friske frivillige

Ja

Beskrivelse

Inkluderingskriterier:

  • Deltakerne må være lisensierte leger og har fullført minst etterutdanningsår 1 (PGY1) av medisinsk opplæring.
  • Opplæring i indremedisin, familiemedisin eller akuttmedisin.

Eksklusjonskriterier:

  • Ikke for tiden praktiserer klinisk.
  • Deltok i en av våre tidligere studier som brukte de samme seks diagnostiske tilfellene.

Studieplan

Denne delen gir detaljer om studieplanen, inkludert hvordan studien er utformet og hva studien måler.

Hvordan er studiet utformet?

Designdetaljer

  • Primært formål: Diagnostisk
  • Tildeling: Randomisert
  • Intervensjonsmodell: Parallell tildeling
  • Masking: Enkelt

Våpen og intervensjoner

Deltakergruppe / Arm
Intervensjon / Behandling
Aktiv komparator: Umiddelbar tilgang til tilpasset versjon av GPT-4
Gruppe vil bli oppfordret til å umiddelbart bruke en tilpasset versjon av GPT-4.
Gruppe får øyeblikkelig tilgang til en tilpasset versjon av GPT-4 for å støtte deres diagnostiske resonnement for hvert tilfelle.
Aktiv komparator: Konvensjonelle ressurser først, deretter gitt tilgang til tilpasset versjon av GPT-4.
Gruppe vil bli oppfordret til først å bruke alle ressurser de ønsker i tillegg til store språkmodeller (Uptodate, PubMed, Google, osv.) Og vil deretter få tilgang til en tilpasset versjon av GPT-4.
Gruppe oppfordres først til å resonnere gjennom diagnostiske tilfeller med støtte fra konvensjonelle ressurser. Etter at de har sendt inn en sak, får de deretter tilgang til en tilpasset versjon av GPT-4 og har muligheten til å endre de første svarene.

Hva måler studien?

Primære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
Diagnostisk resonnement
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
Det primære utfallet vil være prosentandelen av riktige svar per sak (område: 0 til 100). For hvert tilfelle vil deltakerne bli bedt om å gi sine tre beste differensialdiagnoser, sammen med støtte og motstridende funn for hver. De vil motta 1 poeng for hver plausibel diagnose. Støttende og motstridende funn vil bli gradert basert på korrekthet, med 1 poeng for en delvis korrekt respons og 2 poeng for en helt riktig respons. Deltakerne vil deretter velge sin toppdiagnose, og tjene 1 poeng for et rimelig valg og 2 poeng for den mest nøyaktige diagnosen. Til slutt vil de liste opp til tre neste trinn for videre pasientevaluering, med 1 poeng tildelt for en delvis korrekt respons og 2 poeng for en helt riktig respons. Det primære utfallet vil bli analysert på saksnivå, og sammenligner ytelsen mellom de randomiserte studiegruppene.
Gjennom fullføring av studien, i gjennomsnitt 6 måneder

Sekundære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
Tidsbruk per sak
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
Etterforskerne vil sammenligne gjennomsnittlig tid (i minutter) deltakerne bruker på hvert tilfelle på tvers av de to studiearmene.
Gjennom fullføring av studien, i gjennomsnitt 6 måneder
Hurtig frekvens
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
Etterforskerne vil sammenligne hyppigheten av deltakerlys med den tilpassede GPT-4-modellen mellom de to studiegruppene.
Gjennom fullføring av studien, i gjennomsnitt 6 måneder
Sentiment
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
Etterforskerne vil sammenligne tonen og følelsen av deltakernes spørsmål til den tilpassede GPT-4-modellen på tvers av de to studiegruppene. Etterforskerne vil lage et kvalitativt kodesystem for å kategorisere arten av deltakernes spørsmål.
Gjennom fullføring av studien, i gjennomsnitt 6 måneder
Deltakernes oppfatninger av AI i klinisk resonnement
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
Dette utfallet vil bli vurdert i både studiearmer og vil omfatte endringer i holdninger, selvtillit og vilje til å bruke AI -diagnostiske verktøy før og etter å ha blitt utsatt for det tilpassede verktøyet. Vi vil vurdere antall deltakere som var åpne for å bruke AI for å hjelpe til med kompleks klinisk resonnement (pre- og post-quiz), hvis de likte å jobbe med AI-diagnostisk verktøy, hvis de følte at verktøyet ga en verdifull samarbeidsopplevelse for å resonnere, og hvis de ville bruke AI-diagnostisk verktøys anbefalinger økte deres tillit til deres differensi-diagnoser, og hvis de vil bruke AI AI AIs AI-diagnostisering økte med deres differensiodi- Disse vil bli evaluert på en Likert -skala rangering fra sterkt uenig til sterkt enig.
Gjennom fullføring av studien, i gjennomsnitt 6 måneder
Tilpasset GPT-4s diagnostiske resonnement
Tidsramme: Gjennom fullføring av studien, i gjennomsnitt 6 måneder
De tilpassede GPT-4s 'uavhengige' diagnoser vil bli vurdert for nøyaktighet. Utfallet vil være prosentandelen av riktige svar per sak (område: 0 til 100). For hvert tilfelle leder Meta-Prompt den tilpassede GPT-4 til å gi de tre beste differensialdiagnosene, sammen med støtte og motstridende funn for hver, en endelig diagnose og neste trinn. Den tilpassede GPT-4 vil motta 1 poeng for hver plausibel diagnose. Støttende og motstridende funn vil bli gradert basert på korrekthet, med 1 poeng for en delvis korrekt respons og 2 poeng for en helt riktig respons. Toppdiagnosen vil tjene 1 poeng for et rimelig valg og 2 poeng for den mest nøyaktige diagnosen. Til slutt vil den oppgi opptil tre neste trinn for ytterligere pasientevaluering, med 1 poeng tildelt for en delvis korrekt respons og 2 poeng for en helt riktig respons. Utfallet vil bli analysert på saksnivå, og sammenligner ytelse med de randomiserte studiegruppenes score.
Gjennom fullføring av studien, i gjennomsnitt 6 måneder

Samarbeidspartnere og etterforskere

Det er her du vil finne personer og organisasjoner som er involvert i denne studien.

Etterforskere

  • Hovedetterforsker: Jonathan H Chen, MD, PhD, Stanford University

Studierekorddatoer

Disse datoene sporer fremdriften for innsending av studieposter og sammendragsresultater til ClinicalTrials.gov. Studieposter og rapporterte resultater gjennomgås av National Library of Medicine (NLM) for å sikre at de oppfyller spesifikke kvalitetskontrollstandarder før de legges ut på det offentlige nettstedet.

Studer hoveddatoer

Studiestart (Faktiske)

16. desember 2024

Primær fullføring (Faktiske)

24. januar 2025

Studiet fullført (Faktiske)

24. januar 2025

Datoer for studieregistrering

Først innsendt

11. februar 2025

Først innsendt som oppfylte QC-kriteriene

27. mars 2025

Først lagt ut (Faktiske)

4. april 2025

Oppdateringer av studieposter

Sist oppdatering lagt ut (Faktiske)

4. april 2025

Siste oppdatering sendt inn som oppfylte QC-kriteriene

27. mars 2025

Sist bekreftet

1. mars 2025

Mer informasjon

Begreper knyttet til denne studien

Ytterligere relevante MeSH-vilkår

Andre studie-ID-numre

  • 71319c

Plan for individuelle deltakerdata (IPD)

Planlegger du å dele individuelle deltakerdata (IPD)?

NEI

Legemiddel- og utstyrsinformasjon, studiedokumenter

Studerer et amerikansk FDA-regulert medikamentprodukt

Nei

Studerer et amerikansk FDA-regulert enhetsprodukt

Nei

produkt produsert i og eksportert fra USA

Nei

Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .

Abonnere