Deze pagina is automatisch vertaald en de nauwkeurigheid van de vertaling kan niet worden gegarandeerd. Raadpleeg de Engelse versie voor een brontekst.

Diagnostisch redeneren met aangepast GPT-4-model

27 maart 2025 bijgewerkt door: Jonathan Chen, Stanford University

Evaluatie van de prestaties van LLMS en clinici in complexe diagnostische gevallen: een gerandomiseerde gecontroleerde studie

Deze studie zal de impact beoordelen van onmiddellijke toegang tot een aangepaste versie van GPT-4, een groot taalmodel, op prestaties in case-gebaseerde diagnostische redeneringstaken. In het bijzonder zal het deze aanpak vergelijken met een tweestapsproces waarbij deelnemers eerst traditionele diagnostische beslissingsondersteuningstools gebruiken om hun diagnostische redenering te ondersteunen voordat ze toegang krijgen tot het aangepaste GPT-4-model.

Studie Overzicht

Gedetailleerde beschrijving

Artificial Intelligence (AI) -technologieën, met name geavanceerde grote taalmodellen zoals Openai's Chatgpt, hebben het potentieel om de medische besluitvorming te verbeteren. Hoewel CHATGPT-4 niet specifiek is ontworpen voor medische toepassingen, heeft het een belofte aangetoond in verschillende contexten in de gezondheidszorg, waaronder medische notities, het aanpakken van vragen van patiënten en het faciliteren van medische consulten. De impact ervan op de diagnostische redenering van clinici blijft echter grotendeels onbekend.

Klinisch redeneren is een complex proces dat patroonherkenning, kennistoepassing en probabilistische redenering omvat. Het integreren van AI-tools zoals CHATGPT-4 in arts-workflows kan helpen de werklast van artsen te verminderen en de kans op gemiste diagnoses te verminderen. CHATGPT-4 werd echter niet ontwikkeld of gevalideerd voor diagnostische redenering, en het kan misleidende informatie opleveren, inclusief plausibele maar onjuiste conclusies die clinici kunnen misleiden. Als het niet op de juiste manier wordt gebruikt, kan het niet verbeteren en kan het zelfs klinische besluitvorming belemmeren. Daarom is het essentieel om te bestuderen hoe clinici grote taalmodellen gebruiken om klinische redenering te ondersteunen voordat ze worden geïntegreerd in routinematige patiëntenzorg.

Deze studie zal onderzoeken hoe onmiddellijke toegang tot een aangepaste versie van ChatgPT-4 prestaties beïnvloedt op case-gebaseerde diagnostische redeneringstaken, vergeleken met een stapsgewijze aanpak. In de stapsgewijze aanpak zullen deelnemers eerst traditionele diagnostische beslissingsondersteuningshulpmiddelen gebruiken om hun case-redenering te ondersteunen voordat ze interactie hebben met een aangepast ChatGPT-4-model, op welk moment ze de mogelijkheid krijgen om hun eerste antwoorden te herzien.

Deelnemers worden gerandomiseerd in verschillende onderzoeksarmen en zullen reageren op diagnostische gevallen door drie differentiële diagnoses te bieden, samen met ondersteunende en tegengestelde bevindingen voor elk. Ze zullen ook hun topdiagnose identificeren en volgende diagnostische stappen voorstellen. Onafhankelijke reviewers, blind voor behandelingsopdrachten, zullen hun antwoorden evalueren.

Studietype

Ingrijpend

Inschrijving (Werkelijk)

70

Fase

  • Niet toepasbaar

Contacten en locaties

In dit gedeelte vindt u de contactgegevens van degenen die het onderzoek uitvoeren en informatie over waar dit onderzoek wordt uitgevoerd.

Studie Locaties

    • California
      • Palo Alto, California, Verenigde Staten, 94305
        • Stanford University

Deelname Criteria

Onderzoekers zoeken naar mensen die aan een bepaalde beschrijving voldoen, de zogenaamde geschiktheidscriteria. Enkele voorbeelden van deze criteria zijn iemands algemene gezondheidstoestand of eerdere behandelingen.

Geschiktheidscriteria

Leeftijden die in aanmerking komen voor studie

  • Kind
  • Volwassen
  • Oudere volwassene

Accepteert gezonde vrijwilligers

Ja

Beschrijving

Inclusiecriteria:

  • Deelnemers moeten artsen in de vergunning zijn en hebben ten minste postuniversitair jaar 1 (PGY1) van medische training voltooid.
  • Training in interne geneeskunde, huisartsgeneeskunde of spoedeisende geneeskunde.

Uitsluitingscriteria:

  • Momenteel niet klinisch oefenen.
  • Nam deel aan een van onze eerdere studies die dezelfde zes diagnostische gevallen gebruikten.

Studie plan

Dit gedeelte bevat details van het studieplan, inclusief hoe de studie is opgezet en wat de studie meet.

Hoe is de studie opgezet?

Ontwerpdetails

  • Primair doel: Diagnostisch
  • Toewijzing: Gerandomiseerd
  • Interventioneel model: Parallelle opdracht
  • Masker: Enkel

Wapens en interventies

Deelnemersgroep / Arm
Interventie / Behandeling
Actieve vergelijker: Onmiddellijke toegang tot de aangepaste versie van GPT-4
Group zal worden aangemoedigd om onmiddellijk een aangepaste versie van GPT-4 te gebruiken.
Group krijgt onmiddellijke toegang tot een aangepaste versie van GPT-4 om hun diagnostische redenering voor elk geval te ondersteunen.
Actieve vergelijker: Eerst conventionele bronnen, vervolgens toegang tot de aangepaste versie van GPT-4.
Group zal worden aangemoedigd om eerst alle bronnen te gebruiken die ze wensen, naast grote taalmodellen (UptoDate, PubMed, Google, enz.) En krijgt vervolgens toegang tot een aangepaste versie van GPT-4.
Group wordt eerst aangemoedigd om te redeneren door diagnostische gevallen met de ondersteuning van conventionele middelen. Nadat ze de antwoorden van een zaak hebben ingediend, krijgen ze vervolgens toegang tot een aangepaste versie van GPT-4 en hebben ze de mogelijkheid om hun eerste antwoorden te wijzigen.

Wat meet het onderzoek?

Primaire uitkomstmaten

Uitkomstmaat
Maatregel Beschrijving
Tijdsspanne
Diagnostisch redeneren
Tijdsspanne: Door het voltooien van de studie, gemiddeld 6 maanden
Het primaire resultaat zal het percentage correcte reacties per geval zijn (bereik: 0 tot 100). Voor elk geval zullen deelnemers worden gevraagd om hun top drie differentiële diagnoses te bieden, samen met ondersteunende en tegengestelde bevindingen voor elk. Ze ontvangen 1 punt voor elke plausibele diagnose. Ondersteunende en tegengestelde bevindingen worden beoordeeld op basis van correctheid, met 1 punt voor een gedeeltelijk correcte respons en 2 punten voor een volledig correcte reactie. Deelnemers selecteren vervolgens hun topdiagnose en verdienen 1 punt voor een redelijke keuze en 2 punten voor de meest nauwkeurige diagnose. Ten slotte zullen ze maximaal drie volgende stappen vermelden voor verdere evaluatie van de patiënt, met 1 punt toegekend voor een gedeeltelijk correcte respons en 2 punten voor een volledig correcte reactie. De primaire uitkomst zal worden geanalyseerd op casusniveau, waarbij de prestaties tussen de gerandomiseerde studiegroepen worden vergeleken.
Door het voltooien van de studie, gemiddeld 6 maanden

Secundaire uitkomstmaten

Uitkomstmaat
Maatregel Beschrijving
Tijdsspanne
Tijd doorgebracht per geval
Tijdsspanne: Door het voltooien van de studie, gemiddeld 6 maanden
De onderzoekers vergelijken de gemiddelde tijd (in minuten) die deelnemers besteden aan elk geval in de twee studiearmen.
Door het voltooien van de studie, gemiddeld 6 maanden
Snelle frequentie
Tijdsspanne: Door het voltooien van de studie, gemiddeld 6 maanden
De onderzoekers vergelijken de frequentie van deelnemersprompts met het aangepaste GPT-4-model tussen de twee studiegroepen.
Door het voltooien van de studie, gemiddeld 6 maanden
Sentiment
Tijdsspanne: Door het voltooien van de studie, gemiddeld 6 maanden
De onderzoekers zullen de toon en het sentiment van deelnemersprompts vergelijken met het aangepaste GPT-4-model in de twee studiegroepen. De onderzoekers zullen een kwalitatief coderingssysteem maken om de aard van de aanwijzingen van de deelnemers te categoriseren.
Door het voltooien van de studie, gemiddeld 6 maanden
Percepties van deelnemers van AI in klinische redenering
Tijdsspanne: Door het voltooien van de studie, gemiddeld 6 maanden
Deze uitkomst zou worden beoordeeld in beide studiesarmen en zou veranderingen in attitudes, vertrouwen en bereidheid om AI -diagnostische hulpmiddelen te gebruiken voor en na blootstelling aan het aangepaste tool omvatten. We zullen het aantal deelnemers beoordelen dat open stond voor het gebruik van AI om te helpen met complexe klinische redenering (pre- en post-quiz), als ze genoten van het werken met het AI Diagnostic Tool, als ze het gevoel hadden dat de tool een waardevolle samenwerkingservaring bood voor klinische redenering, als het zien van de AI diagnostische tools in hun dagelijkse werkzaamheden in hun dagelijkse taak in hun dagelijkse werkzaamheden in hun dagelijkse werkzaamheden in hun dagelijkse werkzaamheden in hun dagelijkse werkzaamheden in hun dagelijkse taak. Deze zullen worden geëvalueerd op een Likert -schaalranglijst van zeer oneens naar zeer mee eens.
Door het voltooien van de studie, gemiddeld 6 maanden
Aangepaste GPT-4's diagnostische redenering
Tijdsspanne: Door het voltooien van de studie, gemiddeld 6 maanden
De 'onafhankelijke' diagnoses van de aangepaste GPT-4 zullen worden beoordeeld op nauwkeurigheid. De uitkomst zal het percentage correcte reacties per geval zijn (bereik: 0 tot 100). Voor elk geval stuurt het meta-prompt de aangepaste GPT-4 op om zijn top drie differentiële diagnoses te bieden, samen met ondersteunende en tegengestelde bevindingen voor elk, een definitieve diagnose en volgende stappen. De aangepaste GPT-4 ontvangt 1 punt voor elke plausibele diagnose. Ondersteunende en tegengestelde bevindingen worden beoordeeld op basis van correctheid, met 1 punt voor een gedeeltelijk correcte respons en 2 punten voor een volledig correcte reactie. De topdiagnose verdient 1 punt voor een redelijke keuze en 2 punten voor de meest nauwkeurige diagnose. Ten slotte zal het maximaal drie volgende stappen vermelden voor verdere evaluatie van de patiënt, met 1 punt toegekend voor een gedeeltelijk correcte respons en 2 punten voor een volledig correcte respons. De uitkomst zal worden geanalyseerd op casusniveau, waarbij de prestaties worden vergeleken met de scores van de gerandomiseerde studiegroepen.
Door het voltooien van de studie, gemiddeld 6 maanden

Medewerkers en onderzoekers

Hier vindt u mensen en organisaties die betrokken zijn bij dit onderzoek.

Onderzoekers

  • Hoofdonderzoeker: Jonathan H Chen, MD, PhD, Stanford University

Studie record data

Deze datums volgen de voortgang van het onderzoeksdossier en de samenvatting van de ingediende resultaten bij ClinicalTrials.gov. Studieverslagen en gerapporteerde resultaten worden beoordeeld door de National Library of Medicine (NLM) om er zeker van te zijn dat ze voldoen aan specifieke kwaliteitscontrolenormen voordat ze op de openbare website worden geplaatst.

Bestudeer belangrijke data

Studie start (Werkelijk)

16 december 2024

Primaire voltooiing (Werkelijk)

24 januari 2025

Studie voltooiing (Werkelijk)

24 januari 2025

Studieregistratiedata

Eerst ingediend

11 februari 2025

Eerst ingediend dat voldeed aan de QC-criteria

27 maart 2025

Eerst geplaatst (Werkelijk)

4 april 2025

Updates van studierecords

Laatste update geplaatst (Werkelijk)

4 april 2025

Laatste update ingediend die voldeed aan QC-criteria

27 maart 2025

Laatst geverifieerd

1 maart 2025

Meer informatie

Termen gerelateerd aan deze studie

Aanvullende relevante MeSH-voorwaarden

Andere studie-ID-nummers

  • 71319c

Plan Individuele Deelnemersgegevens (IPD)

Bent u van plan om gegevens van individuele deelnemers (IPD) te delen?

NEE

Informatie over medicijnen en apparaten, studiedocumenten

Bestudeert een door de Amerikaanse FDA gereguleerd geneesmiddel

Nee

Bestudeert een door de Amerikaanse FDA gereguleerd apparaatproduct

Nee

product vervaardigd in en geëxporteerd uit de V.S.

Nee

Deze informatie is zonder wijzigingen rechtstreeks van de website clinicaltrials.gov gehaald. Als u verzoeken heeft om uw onderzoeksgegevens te wijzigen, te verwijderen of bij te werken, neem dan contact op met register@clinicaltrials.gov. Zodra er een wijziging wordt doorgevoerd op clinicaltrials.gov, wordt deze ook automatisch bijgewerkt op onze website .

Abonneren