Denne side blev automatisk oversat, og nøjagtigheden af ​​oversættelsen er ikke garanteret. Der henvises til engelsk version for en kildetekst.

Diagnostisk begrundelse med tilpasset GPT-4-model

27. marts 2025 opdateret af: Jonathan Chen, Stanford University

Evaluering af ydelsen af ​​LLM'er og klinikere i komplekse diagnostiske tilfælde: Et randomiseret kontrolleret forsøg

Denne undersøgelse vil vurdere virkningen af ​​øjeblikkelig adgang til en tilpasset version af GPT-4, en stor sprogmodel, på ydeevne i sagsbaserede diagnostiske ræsonnementsopgaver. Specifikt vil det sammenligne denne tilgang til en totrinsproces, hvor deltagerne først bruger traditionelle diagnostiske beslutningsstøtteværktøjer til at understøtte deres diagnostiske ræsonnement, før de får adgang til den tilpassede GPT-4-model.

Studieoversigt

Detaljeret beskrivelse

Kunstig intelligens (AI) -teknologier, især avancerede store sprogmodeller som Openais Chatgpt, har potentialet til at forbedre medicinsk beslutningstagning. Mens ChatGPT-4 ikke var specifikt designet til medicinske applikationer, har det vist løfte i forskellige sundhedsmæssige sammenhænge, ​​herunder medicinsk note-skrivning, adressering af patientundersøgelser og lettelse af medicinsk konsultationer. Imidlertid forbliver dens indflydelse på klinikernes diagnostiske ræsonnement stort set ukendt.

Klinisk ræsonnement er en kompleks proces, der involverer mønstergenkendelse, videnanvendelse og sandsynlig ræsonnement. Integrering af AI-værktøjer som ChatGPT-4 i lægearbejdsgange kan hjælpe med at reducere klinikerens arbejdsbyrde og mindske sandsynligheden for ubesvarede diagnoser. ChatGPT-4 blev imidlertid hverken udviklet eller valideret til diagnostisk ræsonnement, og det kan producere vildledende information, herunder plausible, men forkerte konklusioner, der kunne vildlede klinikere. Hvis det ikke bruges korrekt, kan det ikke forbedre-og kan endda hindre klinisk beslutningstagning. Derfor er det vigtigt at studere, hvordan klinikere bruger store sprogmodeller til at understøtte klinisk ræsonnement, før de integreres i rutinemæssig patientpleje.

Denne undersøgelse vil undersøge, hvordan øjeblikkelig adgang til en tilpasset version af ChatGPT-4 påvirker ydeevnen på case-baserede diagnostiske ræsonnementsopgaver sammenlignet med en trinvis tilgang. I den trinvise tilgang vil deltagerne først bruge traditionelle diagnostiske beslutningsstøtteværktøjer til at understøtte deres sagsbegrundelse, før de interagerer med en tilpasset ChatGPT-4-model, på hvilket tidspunkt de vil have mulighed for at revidere deres oprindelige svar.

Deltagerne vil blive randomiseret i forskellige undersøgelsesarme og vil reagere på diagnostiske tilfælde ved at tilvejebringe tre differentielle diagnoser sammen med understøttende og modstridende fund for hver. De vil også identificere deres topdiagnose og foreslå næste diagnostiske trin. Uafhængige korrekturlæsere, der er blændet for behandlingsopgave, vil evaluere deres svar.

Undersøgelsestype

Interventionel

Tilmelding (Faktiske)

70

Fase

  • Ikke anvendelig

Kontakter og lokationer

Dette afsnit indeholder kontaktoplysninger for dem, der udfører undersøgelsen, og oplysninger om, hvor denne undersøgelse udføres.

Studiesteder

    • California
      • Palo Alto, California, Forenede Stater, 94305
        • Stanford University

Deltagelseskriterier

Forskere leder efter personer, der passer til en bestemt beskrivelse, kaldet berettigelseskriterier. Nogle eksempler på disse kriterier er en persons generelle helbredstilstand eller tidligere behandlinger.

Berettigelseskriterier

Aldre berettiget til at studere

  • Barn
  • Voksen
  • Ældre voksen

Tager imod sunde frivillige

Ja

Beskrivelse

Inkluderingskriterier:

  • Deltagerne skal have licenserede læger og har i det mindste afsluttet postgraduate år 1 (PGY1) for medicinsk uddannelse.
  • Uddannelse i intern medicin, familiemedicin eller akutmedicin.

Ekskluderingskriterier:

  • Ikke i øjeblikket praktiserer klinisk.
  • Deltog i en af ​​vores tidligere undersøgelser, der brugte de samme seks diagnostiske tilfælde.

Studieplan

Dette afsnit indeholder detaljer om studieplanen, herunder hvordan undersøgelsen er designet, og hvad undersøgelsen måler.

Hvordan er undersøgelsen tilrettelagt?

Design detaljer

  • Primært formål: Diagnostisk
  • Tildeling: Randomiseret
  • Interventionel model: Parallel tildeling
  • Maskning: Enkelt

Våben og indgreb

Deltagergruppe / Arm
Intervention / Behandling
Aktiv komparator: Umiddelbar adgang til tilpasset version af GPT-4
Gruppe opfordres til straks at bruge en tilpasset version af GPT-4.
Gruppe får øjeblikkelig adgang til en tilpasset version af GPT-4 til at understøtte deres diagnostiske ræsonnement for hvert enkelt tilfælde.
Aktiv komparator: Konventionelle ressourcer først og tildelte derefter adgang til tilpasset version af GPT-4.
Gruppe vil blive opfordret til først at bruge ressourcer, de ønsker udover store sprogmodeller (Uptodate, PubMed, Google osv.) Og får derefter adgang til en tilpasset version af GPT-4.
Gruppe opfordres først til at resonnere gennem diagnostiske tilfælde med støtte fra konventionelle ressourcer. Når de har indsendt en sags svar, får de derefter adgang til en tilpasset version af GPT-4 og har mulighed for at ændre deres oprindelige svar.

Hvad måler undersøgelsen?

Primære resultatmål

Resultatmål
Foranstaltningsbeskrivelse
Tidsramme
Diagnostisk begrundelse
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
Det primære resultat vil være procentdelen af ​​korrekte svar pr. Sag (rækkevidde: 0 til 100). For hvert tilfælde vil deltagerne blive bedt om at give deres top tre differentielle diagnoser sammen med understøttende og modstridende fund for hver. De vil modtage 1 point for hver plausibel diagnose. Understøttende og modstridende fund klassificeres baseret på korrekthed med 1 point for en delvist korrekt respons og 2 point for et helt korrekt svar. Deltagerne vælger derefter deres topdiagnose og tjener 1 point for et rimeligt valg og 2 point for den mest nøjagtige diagnose. Endelig vil de liste op til tre næste trin for yderligere patientevaluering, med 1 point tildelt for en delvist korrekt respons og 2 point for et helt korrekt svar. Det primære resultat analyseres på sagsniveau og sammenligner ydeevnen mellem de randomiserede studiegrupper.
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder

Sekundære resultatmål

Resultatmål
Foranstaltningsbeskrivelse
Tidsramme
Tid brugt pr. Sag
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
Undersøgere vil sammenligne den gennemsnitlige tid (på få minutter) deltagere tilbringer på hvert tilfælde på tværs af de to studievåben.
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
Hurtig frekvens
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
Undersøgere vil sammenligne hyppigheden af ​​deltagernes promps med den tilpassede GPT-4-model mellem de to studiegrupper.
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
Følelse
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
Undersøgere vil sammenligne tonen og stemningen for deltagernes anmodninger med den tilpassede GPT-4-model på tværs af de to studiegrupper. Undersøgere vil skabe et kvalitativt kodningssystem til at kategorisere arten af ​​deltagernes promp.
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
Deltagernes opfattelse af AI i klinisk ræsonnement
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
Dette resultat vil blive vurderet i både undersøgelsesarme og ville omfatte ændringer i holdninger, selvtillid og vilje til at bruge AI -diagnostiske værktøjer før og efter at have været udsat for det tilpassede værktøj. Vi vil vurdere antallet af deltagere, der var åbne for at bruge AI til at hjælpe med kompleks klinisk ræsonnement (før og efter quiz), hvis de nød at arbejde med AI-diagnostisk værktøj, hvis de følte sig som værktøjet gav en værdifuld samarbejdsoplevelse til klinisk ræsonnement, hvis de så det ene undersøges AI-diagnostiske værktøj øgede deres tillid til deres differentielle diagnoser, og hvis de ville bruge en AI-diagnostisk værktøj som den ene i denne undersøgelse i deres undersøgelse. Disse vil blive evalueret på en Likert -skala rangering fra stærkt uenig til meget enig.
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
Tilpasset GPT-4's diagnostiske ræsonnement
Tidsramme: Gennem undersøgelsesafslutning, i gennemsnit 6 måneder
De tilpassede GPT-4's 'uafhængige' diagnoser vurderes for nøjagtighed. Resultatet vil være procentdelen af ​​korrekte svar pr. Sag (rækkevidde: 0 til 100). For hvert tilfælde instruerer Meta-Prompt den tilpassede GPT-4 til at tilvejebringe sine top tre differentielle diagnoser sammen med understøttende og modsatte fund for hver, en endelig diagnose og næste trin. Den tilpassede GPT-4 modtager 1 point for hver plausibel diagnose. Understøttende og modstridende fund klassificeres baseret på korrekthed med 1 point for en delvist korrekt respons og 2 point for et helt korrekt svar. Dens øverste diagnose vil tjene 1 point for et rimeligt valg og 2 point for den mest nøjagtige diagnose. Endelig viser det op til tre næste trin for yderligere patientevaluering, hvor 1 point blev tildelt for en delvist korrekt respons og 2 point for et helt korrekt svar. Resultatet analyseres på sagsniveau og sammenligner ydeevnen med de randomiserede studiegruppers score.
Gennem undersøgelsesafslutning, i gennemsnit 6 måneder

Samarbejdspartnere og efterforskere

Det er her, du vil finde personer og organisationer, der er involveret i denne undersøgelse.

Efterforskere

  • Ledende efterforsker: Jonathan H Chen, MD, PhD, Stanford University

Datoer for undersøgelser

Disse datoer sporer fremskridtene for indsendelser af undersøgelsesrekord og resumeresultater til ClinicalTrials.gov. Studieregistreringer og rapporterede resultater gennemgås af National Library of Medicine (NLM) for at sikre, at de opfylder specifikke kvalitetskontrolstandarder, før de offentliggøres på den offentlige hjemmeside.

Studer store datoer

Studiestart (Faktiske)

16. december 2024

Primær færdiggørelse (Faktiske)

24. januar 2025

Studieafslutning (Faktiske)

24. januar 2025

Datoer for studieregistrering

Først indsendt

11. februar 2025

Først indsendt, der opfyldte QC-kriterier

27. marts 2025

Først opslået (Faktiske)

4. april 2025

Opdateringer af undersøgelsesjournaler

Sidste opdatering sendt (Faktiske)

4. april 2025

Sidste opdatering indsendt, der opfyldte kvalitetskontrolkriterier

27. marts 2025

Sidst verificeret

1. marts 2025

Mere information

Begreber relateret til denne undersøgelse

Yderligere relevante MeSH-vilkår

Andre undersøgelses-id-numre

  • 71319c

Plan for individuelle deltagerdata (IPD)

Planlægger du at dele individuelle deltagerdata (IPD)?

INGEN

Lægemiddel- og udstyrsoplysninger, undersøgelsesdokumenter

Studerer et amerikansk FDA-reguleret lægemiddelprodukt

Ingen

Studerer et amerikansk FDA-reguleret enhedsprodukt

Ingen

produkt fremstillet i og eksporteret fra U.S.A.

Ingen

Disse oplysninger blev hentet direkte fra webstedet clinicaltrials.gov uden ændringer. Hvis du har nogen anmodninger om at ændre, fjerne eller opdatere dine undersøgelsesoplysninger, bedes du kontakte register@clinicaltrials.gov. Så snart en ændring er implementeret på clinicaltrials.gov, vil denne også blive opdateret automatisk på vores hjemmeside .

Abonner