Diese Seite wurde automatisch übersetzt und die Genauigkeit der Übersetzung wird nicht garantiert. Bitte wende dich an die englische Version für einen Quelltext.

Diagnostisches Denken mit maßgeschneidertem GPT-4-Modell

27. März 2025 aktualisiert von: Jonathan Chen, Stanford University

Bewertung der Leistung von LLMs und Klinikern in komplexen diagnostischen Fällen: Eine randomisierte kontrollierte Studie

Diese Studie bewertet die Auswirkungen des sofortigen Zugriffs auf eine maßgeschneiderte Version von GPT-4, einem großen Sprachmodell, auf die Leistung in fallbasierten diagnostischen Argumentationsaufgaben. Insbesondere wird es diesen Ansatz mit einem zweistufigen Prozess vergleichen, bei dem die Teilnehmer zunächst herkömmliche Tools für diagnostische Entscheidungsunterstützung verwenden, um deren diagnostische Argumentation zu unterstützen, bevor er Zugriff auf das maßgeschneiderte GPT-4-Modell erhält.

Studienübersicht

Detaillierte Beschreibung

KI-Technologien für künstliche Intelligenz (KI), insbesondere fortgeschrittene Großsprachenmodelle wie das ChatGPT von Openai, können die medizinische Entscheidungsfindung verbessern. Während ChatGPT-4 nicht speziell für medizinische Anwendungen entwickelt wurde, hat es in verschiedenen Kontexten im Gesundheitswesen vielversprechend gezeigt, einschließlich medizinischer Notizbeschreibung, Bekämpfung von Patientenanfragen und Erleichterung der medizinischen Konsultationen. Die Auswirkungen des diagnostischen Denkens der Kliniker sind jedoch weitgehend unbekannt.

Klinisches Denken ist ein komplexer Prozess, der Mustererkennung, Wissensanwendung und probabilistisches Denken beinhaltet. Durch die Integration von KI-Tools wie ChatGPT-4 in Ärzte-Arbeitsabläufe kann die Arbeitsbelastung der Kliniker verringert und die Wahrscheinlichkeit fehlender Diagnosen verringert werden. Chatgpt-4 wurde jedoch weder für diagnostische Argumentation entwickelt noch validiert, und es kann jedoch irreführende Informationen erzeugen, einschließlich plausibler, aber falscher Schlussfolgerungen, die Kliniker fehlleiten könnten. Wenn es nicht angemessen verwendet wird, kann es sich möglicherweise nicht verbessern und sogar die klinische Entscheidungsfindung behindern. Daher ist es wichtig zu untersuchen, wie Kliniker große Sprachmodelle verwenden, um das klinische Denken zu unterstützen, bevor sie in die routinemäßige Patientenversorgung integriert werden.

In dieser Studie wird untersucht, wie der sofortige Zugriff auf eine individuelle Version von ChatGPT-4 die Leistung auf fallbasierte diagnostische Argumentationsaufgaben im Vergleich zu einem schrittweisen Ansatz beeinflusst. Im schrittweisen Ansatz werden die Teilnehmer zunächst herkömmliche Tools für diagnostische Entscheidungsunterstützung verwenden, um deren Fallgut zu unterstützen, bevor sie mit einem maßgeschneiderten ChatGPT-4-Modell interagieren. Zu diesem Zeitpunkt haben sie die Möglichkeit, ihre ersten Antworten zu überarbeiten.

Die Teilnehmer werden in unterschiedliche Studienarme randomisiert und auf diagnostische Fälle reagieren, indem sie drei Differentialdiagnosen sowie für jeweils unterstützende und entgegengesetzte Befunde bereitstellen. Sie werden auch ihre oberste Diagnose identifizieren und die nächsten diagnostischen Schritte vorschlagen. Unabhängige Gutachter, die für Behandlungszuweisungen blind, werden ihre Antworten bewerten.

Studientyp

Interventionell

Einschreibung (Tatsächlich)

70

Phase

  • Unzutreffend

Kontakte und Standorte

Dieser Abschnitt enthält die Kontaktdaten derjenigen, die die Studie durchführen, und Informationen darüber, wo diese Studie durchgeführt wird.

Studienorte

    • California
      • Palo Alto, California, Vereinigte Staaten, 94305
        • Stanford University

Teilnahmekriterien

Forscher suchen nach Personen, die einer bestimmten Beschreibung entsprechen, die als Auswahlkriterien bezeichnet werden. Einige Beispiele für diese Kriterien sind der allgemeine Gesundheitszustand einer Person oder frühere Behandlungen.

Zulassungskriterien

Studienberechtigtes Alter

  • Kind
  • Erwachsene
  • Älterer Erwachsener

Akzeptiert gesunde Freiwillige

Ja

Beschreibung

Einschlusskriterien:

  • Die Teilnehmer müssen lizenzierte Ärzte sein und haben mindestens die medizinische Ausbildung des Jahres 1 (PGY1) abgeschlossen.
  • Ausbildung in Inneren Medizin, Familienmedizin oder Notfallmedizin.

Ausschlusskriterien:

  • Derzeit nicht klinisch praktizieren.
  • Nahm an einer unserer früheren Studien teil, die dieselben sechs diagnostischen Fälle verwendeten.

Studienplan

Dieser Abschnitt enthält Einzelheiten zum Studienplan, einschließlich des Studiendesigns und der Messung der Studieninhalte.

Wie ist die Studie aufgebaut?

Designdetails

  • Hauptzweck: Diagnose
  • Zuteilung: Zufällig
  • Interventionsmodell: Parallele Zuordnung
  • Maskierung: Single

Waffen und Interventionen

Teilnehmergruppe / Arm
Intervention / Behandlung
Aktiver Komparator: Sofortiger Zugriff auf eine angepasste Version von GPT-4
Die Gruppe wird aufgefordert, sofort eine angepasste Version von GPT-4 zu verwenden.
Die Gruppe erhält sofortiger Zugriff auf eine individuelle Version von GPT-4, um ihre diagnostische Argumentation für jeden Fall zu unterstützen.
Aktiver Komparator: Konventionelle Ressourcen erteilten dann zuerst Zugriff auf eine maßgeschneiderte Version von GPT-4.
Die Gruppe wird ermutigt, zuerst alle Ressourcen zu verwenden, die sie sich wünschen, neben großen Sprachmodellen (Uptodate, PubMed, Google usw.) und wird dann Zugriff auf eine individuelle Version von GPT-4 gewährt.
Die Gruppe wird zunächst ermutigt, durch diagnostische Fälle mit Unterstützung herkömmlicher Ressourcen zu argumentieren. Nachdem sie die Antworten eines Falls eingereicht haben, erhalten sie dann Zugriff auf eine individuelle Version von GPT-4 und haben die Möglichkeit, ihre ersten Antworten zu ändern.

Was misst die Studie?

Primäre Ergebnismessungen

Ergebnis Maßnahme
Maßnahmenbeschreibung
Zeitfenster
Diagnostisches Denken
Zeitfenster: Durch Abschluss der Studie durchschnittlich 6 Monate
Das primäre Ergebnis ist der Prozentsatz der korrekten Antworten pro Fall (Bereich: 0 bis 100). Für jeden Fall werden die Teilnehmer gebeten, ihre drei wichtigsten Differentialdiagnosen sowie für jeweils unterstützende und entgegengesetzte Ergebnisse bereitzustellen. Sie erhalten 1 Punkt für jede plausible Diagnose. Unterstützende und entgegengesetzte Ergebnisse werden auf der Grundlage der Korrektheit bewertet, mit 1 Punkt für eine teilweise korrekte Antwort und 2 Punkte für eine vollständig korrekte Antwort. Die Teilnehmer wählen dann ihre oberste Diagnose aus und verdienen 1 Punkt für eine angemessene Auswahl und 2 Punkte für die genaueste Diagnose. Schließlich werden bis zu drei nächste Schritte für die weitere Bewertung der Patienten aufgeführt, wobei 1 Punkt für eine teilweise korrekte Antwort und 2 Punkte für eine völlig korrekte Antwort vergeben wurde. Das primäre Ergebnis wird auf der Fallebene analysiert, wobei die Leistung zwischen den randomisierten Studiengruppen verglichen wird.
Durch Abschluss der Studie durchschnittlich 6 Monate

Sekundäre Ergebnismessungen

Ergebnis Maßnahme
Maßnahmenbeschreibung
Zeitfenster
Zeit pro Fall verbracht
Zeitfenster: Durch Abschluss der Studie durchschnittlich 6 Monate
Die Ermittler vergleichen die durchschnittlichen Zeit (in wenigen Minuten), die die Teilnehmer für jeden Fall in den beiden Studienarmen ausgeben.
Durch Abschluss der Studie durchschnittlich 6 Monate
Sofortige Frequenz
Zeitfenster: Durch Abschluss der Studie durchschnittlich 6 Monate
Die Ermittler vergleichen die Häufigkeit der Teilnehmeraufforderungen mit dem maßgeschneiderten GPT-4-Modell zwischen den beiden Studiengruppen.
Durch Abschluss der Studie durchschnittlich 6 Monate
Gefühl
Zeitfenster: Durch Abschluss der Studie durchschnittlich 6 Monate
Die Ermittler vergleichen den Ton und die Stimmung der Teilnehmeraufforderungen mit dem maßgeschneiderten GPT-4-Modell in den beiden Studiengruppen. Die Ermittler erstellen ein qualitatives Codierungssystem, um die Art der Eingabeaufforderungen der Teilnehmer zu kategorisieren.
Durch Abschluss der Studie durchschnittlich 6 Monate
Die Wahrnehmung der KI der Teilnehmer im klinischen Denken
Zeitfenster: Durch Abschluss der Studie durchschnittlich 6 Monate
Dieses Ergebnis würde in beiden Studienarmen bewertet und würden Änderungen der Einstellungen, des Vertrauens und der Bereitschaft umfassen, AI -diagnostische Tools vor und nach der Exposition gegenüber dem maßgeschneiderten Tool zu verwenden. Wir werden die Anzahl der Teilnehmer beurteilen, die offen für die Verwendung von KI zur Unterstützung des komplexen klinischen Denkens (vor und nach dem Quiz), wenn sie gerne mit dem KI-Diagnostikwerkzeug zusammenarbeiteten, wenn sie das Gefühl hatten, dass das Tool eine wertvolle Zusammenarbeit für die klinische Überlegungen für klinische Argumentation lieferte. Diese werden in einer Likert -Skala bewertet, die von stark nicht einverstanden ist, um stark zuzustimmen.
Durch Abschluss der Studie durchschnittlich 6 Monate
Die diagnostische Argumentation von Customized GPT-4
Zeitfenster: Durch Abschluss der Studie durchschnittlich 6 Monate
Die "unabhängigen" GPT-4-Diagnosen werden auf Genauigkeit bewertet. Das Ergebnis ist der Prozentsatz der korrekten Antworten pro Fall (Bereich: 0 bis 100). Für jeden Fall lenkt der Meta-Prompt die maßgeschneiderte GPT-4, um seine drei wichtigsten Differentialdiagnosen sowie für jeden unterstützenden und entgegengesetzten Befunde zu liefern, eine endgültige Diagnose und die nächsten Schritte. Der maßgeschneiderte GPT-4 erhält 1 Punkt für jede plausible Diagnose. Unterstützende und entgegengesetzte Ergebnisse werden auf der Grundlage der Korrektheit bewertet, mit 1 Punkt für eine teilweise korrekte Antwort und 2 Punkte für eine vollständig korrekte Antwort. Die oberste Diagnose wird 1 Punkt für eine angemessene Auswahl und 2 Punkte für die genaueste Diagnose verdienen. Schließlich werden bis zu drei nächste Schritte für die weitere Bewertung der Patienten aufgeführt, wobei 1 Punkt für eine teilweise korrekte Antwort und 2 Punkte für eine völlig korrekte Antwort vergeben wird. Das Ergebnis wird auf der Fallebene analysiert und die Leistung mit den Bewertungen der randomisierten Studiengruppen verglichen.
Durch Abschluss der Studie durchschnittlich 6 Monate

Mitarbeiter und Ermittler

Hier finden Sie Personen und Organisationen, die an dieser Studie beteiligt sind.

Ermittler

  • Hauptermittler: Jonathan H Chen, MD, PhD, Stanford University

Studienaufzeichnungsdaten

Diese Daten verfolgen den Fortschritt der Übermittlung von Studienaufzeichnungen und zusammenfassenden Ergebnissen an ClinicalTrials.gov. Studienaufzeichnungen und gemeldete Ergebnisse werden von der National Library of Medicine (NLM) überprüft, um sicherzustellen, dass sie bestimmten Qualitätskontrollstandards entsprechen, bevor sie auf der öffentlichen Website veröffentlicht werden.

Haupttermine studieren

Studienbeginn (Tatsächlich)

16. Dezember 2024

Primärer Abschluss (Tatsächlich)

24. Januar 2025

Studienabschluss (Tatsächlich)

24. Januar 2025

Studienanmeldedaten

Zuerst eingereicht

11. Februar 2025

Zuerst eingereicht, das die QC-Kriterien erfüllt hat

27. März 2025

Zuerst gepostet (Tatsächlich)

4. April 2025

Studienaufzeichnungsaktualisierungen

Letztes Update gepostet (Tatsächlich)

4. April 2025

Letztes eingereichtes Update, das die QC-Kriterien erfüllt

27. März 2025

Zuletzt verifiziert

1. März 2025

Mehr Informationen

Begriffe im Zusammenhang mit dieser Studie

Zusätzliche relevante MeSH-Bedingungen

Andere Studien-ID-Nummern

  • 71319c

Plan für individuelle Teilnehmerdaten (IPD)

Planen Sie, individuelle Teilnehmerdaten (IPD) zu teilen?

NEIN

Arzneimittel- und Geräteinformationen, Studienunterlagen

Studiert ein von der US-amerikanischen FDA reguliertes Arzneimittelprodukt

Nein

Studiert ein von der US-amerikanischen FDA reguliertes Geräteprodukt

Nein

Produkt, das in den USA hergestellt und aus den USA exportiert wird

Nein

Diese Informationen wurden ohne Änderungen direkt von der Website clinicaltrials.gov abgerufen. Wenn Sie Ihre Studiendaten ändern, entfernen oder aktualisieren möchten, wenden Sie sich bitte an register@clinicaltrials.gov. Sobald eine Änderung auf clinicaltrials.gov implementiert wird, wird diese automatisch auch auf unserer Website aktualisiert .

Abonnieren