- ICH GCP
- US Clinical Trials Registry
- Klinisk forsøg NCT06911645
Diagnostisk begrundelse med tilpasset GPT-4-model
Evaluering af ydelsen af LLM'er og klinikere i komplekse diagnostiske tilfælde: Et randomiseret kontrolleret forsøg
Studieoversigt
Status
Betingelser
Detaljeret beskrivelse
Kunstig intelligens (AI) -teknologier, især avancerede store sprogmodeller som Openais Chatgpt, har potentialet til at forbedre medicinsk beslutningstagning. Mens ChatGPT-4 ikke var specifikt designet til medicinske applikationer, har det vist løfte i forskellige sundhedsmæssige sammenhænge, herunder medicinsk note-skrivning, adressering af patientundersøgelser og lettelse af medicinsk konsultationer. Imidlertid forbliver dens indflydelse på klinikernes diagnostiske ræsonnement stort set ukendt.
Klinisk ræsonnement er en kompleks proces, der involverer mønstergenkendelse, videnanvendelse og sandsynlig ræsonnement. Integrering af AI-værktøjer som ChatGPT-4 i lægearbejdsgange kan hjælpe med at reducere klinikerens arbejdsbyrde og mindske sandsynligheden for ubesvarede diagnoser. ChatGPT-4 blev imidlertid hverken udviklet eller valideret til diagnostisk ræsonnement, og det kan producere vildledende information, herunder plausible, men forkerte konklusioner, der kunne vildlede klinikere. Hvis det ikke bruges korrekt, kan det ikke forbedre-og kan endda hindre klinisk beslutningstagning. Derfor er det vigtigt at studere, hvordan klinikere bruger store sprogmodeller til at understøtte klinisk ræsonnement, før de integreres i rutinemæssig patientpleje.
Denne undersøgelse vil undersøge, hvordan øjeblikkelig adgang til en tilpasset version af ChatGPT-4 påvirker ydeevnen på case-baserede diagnostiske ræsonnementsopgaver sammenlignet med en trinvis tilgang. I den trinvise tilgang vil deltagerne først bruge traditionelle diagnostiske beslutningsstøtteværktøjer til at understøtte deres sagsbegrundelse, før de interagerer med en tilpasset ChatGPT-4-model, på hvilket tidspunkt de vil have mulighed for at revidere deres oprindelige svar.
Deltagerne vil blive randomiseret i forskellige undersøgelsesarme og vil reagere på diagnostiske tilfælde ved at tilvejebringe tre differentielle diagnoser sammen med understøttende og modstridende fund for hver. De vil også identificere deres topdiagnose og foreslå næste diagnostiske trin. Uafhængige korrekturlæsere, der er blændet for behandlingsopgave, vil evaluere deres svar.
Undersøgelsestype
Tilmelding (Faktiske)
Fase
- Ikke anvendelig
Kontakter og lokationer
Studiesteder
-
-
California
-
Palo Alto, California, Forenede Stater, 94305
- Stanford University
-
-
Deltagelseskriterier
Berettigelseskriterier
Aldre berettiget til at studere
- Barn
- Voksen
- Ældre voksen
Tager imod sunde frivillige
Beskrivelse
Inkluderingskriterier:
- Deltagerne skal have licenserede læger og har i det mindste afsluttet postgraduate år 1 (PGY1) for medicinsk uddannelse.
- Uddannelse i intern medicin, familiemedicin eller akutmedicin.
Ekskluderingskriterier:
- Ikke i øjeblikket praktiserer klinisk.
- Deltog i en af vores tidligere undersøgelser, der brugte de samme seks diagnostiske tilfælde.
Studieplan
Hvordan er undersøgelsen tilrettelagt?
Design detaljer
- Primært formål: Diagnostisk
- Tildeling: Randomiseret
- Interventionel model: Parallel tildeling
- Maskning: Enkelt
Våben og indgreb
Deltagergruppe / Arm |
Intervention / Behandling |
|---|---|
|
Aktiv komparator: Umiddelbar adgang til tilpasset version af GPT-4
Gruppe opfordres til straks at bruge en tilpasset version af GPT-4.
|
Gruppe får øjeblikkelig adgang til en tilpasset version af GPT-4 til at understøtte deres diagnostiske ræsonnement for hvert enkelt tilfælde.
|
|
Aktiv komparator: Konventionelle ressourcer først og tildelte derefter adgang til tilpasset version af GPT-4.
Gruppe vil blive opfordret til først at bruge ressourcer, de ønsker udover store sprogmodeller (Uptodate, PubMed, Google osv.) Og får derefter adgang til en tilpasset version af GPT-4.
|
Gruppe opfordres først til at resonnere gennem diagnostiske tilfælde med støtte fra konventionelle ressourcer.
Når de har indsendt en sags svar, får de derefter adgang til en tilpasset version af GPT-4 og har mulighed for at ændre deres oprindelige svar.
|
Hvad måler undersøgelsen?
Primære resultatmål
Resultatmål |
Foranstaltningsbeskrivelse |
Tidsramme |
|---|---|---|
|
Diagnostisk begrundelse
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
Det primære resultat vil være procentdelen af korrekte svar pr. Sag (rækkevidde: 0 til 100).
For hvert tilfælde vil deltagerne blive bedt om at give deres top tre differentielle diagnoser sammen med understøttende og modstridende fund for hver.
De vil modtage 1 point for hver plausibel diagnose.
Understøttende og modstridende fund klassificeres baseret på korrekthed med 1 point for en delvist korrekt respons og 2 point for et helt korrekt svar.
Deltagerne vælger derefter deres topdiagnose og tjener 1 point for et rimeligt valg og 2 point for den mest nøjagtige diagnose.
Endelig vil de liste op til tre næste trin for yderligere patientevaluering, med 1 point tildelt for en delvist korrekt respons og 2 point for et helt korrekt svar.
Det primære resultat analyseres på sagsniveau og sammenligner ydeevnen mellem de randomiserede studiegrupper.
|
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
Sekundære resultatmål
Resultatmål |
Foranstaltningsbeskrivelse |
Tidsramme |
|---|---|---|
|
Tid brugt pr. Sag
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
Undersøgere vil sammenligne den gennemsnitlige tid (på få minutter) deltagere tilbringer på hvert tilfælde på tværs af de to studievåben.
|
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
|
Hurtig frekvens
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
Undersøgere vil sammenligne hyppigheden af deltagernes promps med den tilpassede GPT-4-model mellem de to studiegrupper.
|
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
|
Følelse
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
Undersøgere vil sammenligne tonen og stemningen for deltagernes anmodninger med den tilpassede GPT-4-model på tværs af de to studiegrupper.
Undersøgere vil skabe et kvalitativt kodningssystem til at kategorisere arten af deltagernes promp.
|
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
|
Deltagernes opfattelse af AI i klinisk ræsonnement
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
Dette resultat vil blive vurderet i både undersøgelsesarme og ville omfatte ændringer i holdninger, selvtillid og vilje til at bruge AI -diagnostiske værktøjer før og efter at have været udsat for det tilpassede værktøj.
Vi vil vurdere antallet af deltagere, der var åbne for at bruge AI til at hjælpe med kompleks klinisk ræsonnement (før og efter quiz), hvis de nød at arbejde med AI-diagnostisk værktøj, hvis de følte sig som værktøjet gav en værdifuld samarbejdsoplevelse til klinisk ræsonnement, hvis de så det ene undersøges AI-diagnostiske værktøj øgede deres tillid til deres differentielle diagnoser, og hvis de ville bruge en AI-diagnostisk værktøj som den ene i denne undersøgelse i deres undersøgelse.
Disse vil blive evalueret på en Likert -skala rangering fra stærkt uenig til meget enig.
|
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
|
Tilpasset GPT-4's diagnostiske ræsonnement
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
De tilpassede GPT-4's 'uafhængige' diagnoser vurderes for nøjagtighed.
Resultatet vil være procentdelen af korrekte svar pr. Sag (rækkevidde: 0 til 100).
For hvert tilfælde instruerer Meta-Prompt den tilpassede GPT-4 til at tilvejebringe sine top tre differentielle diagnoser sammen med understøttende og modsatte fund for hver, en endelig diagnose og næste trin.
Den tilpassede GPT-4 modtager 1 point for hver plausibel diagnose.
Understøttende og modstridende fund klassificeres baseret på korrekthed med 1 point for en delvist korrekt respons og 2 point for et helt korrekt svar.
Dens øverste diagnose vil tjene 1 point for et rimeligt valg og 2 point for den mest nøjagtige diagnose.
Endelig viser det op til tre næste trin for yderligere patientevaluering, hvor 1 point blev tildelt for en delvist korrekt respons og 2 point for et helt korrekt svar.
Resultatet analyseres på sagsniveau og sammenligner ydeevnen med de randomiserede studiegruppers score.
|
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
|
Samarbejdspartnere og efterforskere
Sponsor
Samarbejdspartnere
Efterforskere
- Ledende efterforsker: Jonathan H Chen, MD, PhD, Stanford University
Datoer for undersøgelser
Studer store datoer
Studiestart (Faktiske)
Primær færdiggørelse (Faktiske)
Studieafslutning (Faktiske)
Datoer for studieregistrering
Først indsendt
Først indsendt, der opfyldte QC-kriterier
Først opslået (Faktiske)
Opdateringer af undersøgelsesjournaler
Sidste opdatering sendt (Faktiske)
Sidste opdatering indsendt, der opfyldte kvalitetskontrolkriterier
Sidst verificeret
Mere information
Begreber relateret til denne undersøgelse
Yderligere relevante MeSH-vilkår
Andre undersøgelses-id-numre
- 71319c
Plan for individuelle deltagerdata (IPD)
Planlægger du at dele individuelle deltagerdata (IPD)?
Lægemiddel- og udstyrsoplysninger, undersøgelsesdokumenter
Studerer et amerikansk FDA-reguleret lægemiddelprodukt
Studerer et amerikansk FDA-reguleret enhedsprodukt
produkt fremstillet i og eksporteret fra U.S.A.
Disse oplysninger blev hentet direkte fra webstedet clinicaltrials.gov uden ændringer. Hvis du har nogen anmodninger om at ændre, fjerne eller opdatere dine undersøgelsesoplysninger, bedes du kontakte register@clinicaltrials.gov. Så snart en ændring er implementeret på clinicaltrials.gov, vil denne også blive opdateret automatisk på vores hjemmeside .