このページは自動翻訳されたものであり、翻訳の正確性は保証されていません。を参照してください。 英語版 ソーステキスト用。

カスタマイズされたGPT-4モデルを使用した診断推論

2025年3月27日 更新者:Jonathan Chen、Stanford University

複雑な診断症例におけるLLMSと臨床医のパフォーマンスの評価:ランダム化比較試験

この研究では、大規模な言語モデルであるGPT-4のカスタマイズされたバージョンへの即時アクセスの影響を、ケースベースの診断推論タスクのパフォーマンスに評価します。 具体的には、このアプローチを2段階のプロセスと比較し、参加者が最初に従来の診断意思決定サポートツールを使用して、カスタマイズされたGPT-4モデルにアクセスする前に診断推論をサポートします。

調査の概要

詳細な説明

人工知能(AI)テクノロジー、特にOpenaiのChatGPTのような高度な大規模な言語モデルは、医学的意思決定を強化する可能性があります。 CHATGPT-4は医療用途向けに特別に設計されていませんが、医療メモの作成、患者の問い合わせへの対処、医療相談の促進など、さまざまなヘルスケアの状況で約束を実証しています。 ただし、臨床医の診断推論への影響はほとんど不明のままです。

臨床的推論は、パターン認識、知識適用、および確率的推論を含む複雑なプロセスです。 CHATGPT-4などのAIツールを医師のワークフローに統合すると、臨床医のワークロードを減らし、診断を逃した可能性を減らすことができます。 ただし、CHATGPT-4は診断推論のために開発も検証もされておらず、臨床医を誤って誘導する可能性のある妥当ではあるが誤った結論を含む誤解を招く情報を生成する可能性があります。 適切に使用されない場合、改善できず、臨床的な意思決定を妨げる可能性があります。 したがって、臨床医が大規模な言語モデルを使用して臨床的推論をサポートする方法を、日常的な患者ケアに統合する方法を研究することが不可欠です。

この研究では、CHATGPT-4のカスタマイズされたバージョンへの即時アクセスが、段階的なアプローチと比較して、ケースベースの診断推論タスクのパフォーマンスにどのように影響するかを調べます。 段階的なアプローチでは、参加者は最初に従来の診断意思決定サポートツールを使用して、カスタマイズされたChatGPT-4モデルとやり取りする前に、ケースの推論をサポートします。この時点で、最初の回答を修正する機会があります。

参加者はさまざまな研究群にランダム化され、3つの鑑別診断を提供することと、それぞれのサポートと対立する結果を提供することにより、診断症例に対応します。 また、彼らは彼らの最高の診断を特定し、次の診断手順を提案します。 治療の割り当てを盲目にした独立したレビュアーは、彼らの回答を評価します。

研究の種類

介入

入学 (実際)

70

段階

  • 適用できない

連絡先と場所

このセクションには、調査を実施する担当者の連絡先の詳細と、この調査が実施されている場所に関する情報が記載されています。

研究場所

    • California
      • Palo Alto、California、アメリカ、94305
        • Stanford University

参加基準

研究者は、適格基準と呼ばれる特定の説明に適合する人を探します。これらの基準のいくつかの例は、人の一般的な健康状態または以前の治療です。

適格基準

就学可能な年齢

  • 子
  • 大人
  • 高齢者

健康ボランティアの受け入れ

はい

説明

包含基準:

  • 参加者は認可された医師であり、少なくとも卒業後1年(PGY1)を医療訓練を完了している必要があります。
  • 内科、家庭医学、または救急医療のトレーニング。

除外基準:

  • 現在、臨床的に練習していません。
  • 同じ6つの診断症例を使用した以前の研究の1つに参加しました。

研究計画

このセクションでは、研究がどのように設計され、研究が何を測定しているかなど、研究計画の詳細を提供します。

研究はどのように設計されていますか?

デザインの詳細

  • 主な目的:診断
  • 割り当て:ランダム化
  • 介入モデル:並列代入
  • マスキング:独身

武器と介入

参加者グループ / アーム
介入・治療
アクティブコンパレータ:GPT-4のカスタマイズされたバージョンへの即時アクセス
グループは、GPT-4のカスタマイズされたバージョンをすぐに使用することをお勧めします。
グループには、各ケースの診断推論をサポートするために、GPT-4のカスタマイズされたバージョンに即座にアクセスできます。
アクティブコンパレータ:最初に従来のリソース、次にGPT-4のカスタマイズされたバージョンへのアクセスを許可されました。
グループは、最初に大規模な言語モデル(Uptodate、PubMed、Googleなど)以外に希望するリソースを使用することをお勧めし、次にGPT-4のカスタマイズされたバージョンへのアクセスが許可されます。
グループは、従来のリソースをサポートして、診断ケースを通じて推論することを最初に奨励されています。 ケースの回答を送信した後、GPT-4のカスタマイズされたバージョンへのアクセスが与えられ、最初の回答を変更する機会があります。

この研究は何を測定していますか?

主要な結果の測定

結果測定
メジャーの説明
時間枠
診断推論
時間枠:研究の完了を通じて、平均6か月
主な結果は、ケースあたりの正しい応答の割合です(範囲:0〜100)。 各ケースについて、参加者は、それぞれのサポートと対立する結果とともに、上位3つの鑑別診断を提供するように求められます。 彼らは、もっともらしい診断ごとに1ポイントを受け取ります。 サポートと対立する調査結果は、正確性に基づいて格付けされ、部分的に正しい応答の場合は1ポイント、完全に正しい応答の場合は2ポイントです。 その後、参加者は最高の診断を選択し、合理的な選択のために1ポイントを獲得し、最も正確な診断のために2ポイントを獲得します。 最後に、彼らはさらに患者評価のために最大3つの次のステップをリストし、部分的に正しい応答に対して1ポイント、完全に正しい応答のために2ポイントを授与します。 主要な結果は、ランダム化研究グループ間のパフォーマンスを比較して、症例レベルで分析されます。
研究の完了を通じて、平均6か月

二次結果の測定

結果測定
メジャーの説明
時間枠
ケースごとに費やした時間
時間枠:研究の完了を通じて、平均6か月
調査員は、2つの研究群で各ケースに参加者が費やす平均時間(数分で)を比較します。
研究の完了を通じて、平均6か月
迅速な頻度
時間枠:研究の完了を通じて、平均6か月
調査員は、参加者プロンプトの頻度を、2つの研究グループ間でカスタマイズされたGPT-4モデルと比較します。
研究の完了を通じて、平均6か月
感情
時間枠:研究の完了を通じて、平均6か月
調査員は、参加者プロンプトのトーンと感情を、2つの研究グループ全体でカスタマイズされたGPT-4モデルと比較します。 調査員は、参加者のプロンプトの性質を分類するための定性的コーディングシステムを作成します。
研究の完了を通じて、平均6か月
臨床推論におけるAIの参加者の認識
時間枠:研究の完了を通じて、平均6か月
この結果は両方の研究腕で評価され、カスタマイズされたツールにさらされる前後にAI診断ツールを使用する態度、自信、意欲の変化を網羅します。 AI診断ツールの操作を楽しんだ場合、AI診断ツールの貴重な共同体験を提供する場合、AI診断ツールの推奨事項を見た場合、AI診断での自信を高め、AI診断での自信を持っている場合、AI診断において自信を持っている場合に自信を持っているかどうかを確認する場合、AI診断ツールの操作を楽しんだ場合、AIを使用して複雑な臨床推論(Quiz前後)を支援するためにAIを使用することにオープンな参加者の数を評価します。 これらは、強く同意しないものから強く同意するリッカートスケールで評価されます。
研究の完了を通じて、平均6か月
カスタマイズされたGPT-4の診断推論
時間枠:研究の完了を通じて、平均6か月
カスタマイズされたGPT-4の「独立」診断は、精度を評価します。 結果は、ケースあたりの正しい応答の割合になります(範囲:0〜100)。 各ケースについて、Meta-Promptは、カスタマイズされたGPT-4に上位3つの鑑別診断を提供するよう指示し、それぞれのサポートと対立する結果、最終診断、および次のステップを指示します。 カスタマイズされたGPT-4は、もっともらしい診断ごとに1ポイントを受け取ります。 サポートと対立する調査結果は、正確性に基づいて格付けされ、部分的に正しい応答の場合は1ポイント、完全に正しい応答の場合は2ポイントです。 その最高の診断は、合理的な選択のために1ポイント、最も正確な診断のために2ポイントを獲得します。 最後に、さらなる患者評価のために最大3つの次のステップをリストし、部分的に正しい応答に対して1ポイント、完全に正しい応答のために2ポイントを授与します。 結果はケースレベルで分析され、パフォーマンスとランダム化研究グループのスコアを比較します。
研究の完了を通じて、平均6か月

協力者と研究者

ここでは、この調査に関係する人々や組織を見つけることができます。

スポンサー

捜査官

  • 主任研究者:Jonathan H Chen, MD, PhD、Stanford University

研究記録日

これらの日付は、ClinicalTrials.gov への研究記録と要約結果の提出の進捗状況を追跡します。研究記録と報告された結果は、国立医学図書館 (NLM) によって審査され、公開 Web サイトに掲載される前に、特定の品質管理基準を満たしていることが確認されます。

主要日程の研究

研究開始 (実際)

2024年12月16日

一次修了 (実際)

2025年1月24日

研究の完了 (実際)

2025年1月24日

試験登録日

最初に提出

2025年2月11日

QC基準を満たした最初の提出物

2025年3月27日

最初の投稿 (実際)

2025年4月4日

学習記録の更新

投稿された最後の更新 (実際)

2025年4月4日

QC基準を満たした最後の更新が送信されました

2025年3月27日

最終確認日

2025年3月1日

詳しくは

本研究に関する用語

追加の関連 MeSH 用語

その他の研究ID番号

  • 71319c

個々の参加者データ (IPD) の計画

個々の参加者データ (IPD) を共有する予定はありますか?

いいえ

医薬品およびデバイス情報、研究文書

米国FDA規制医薬品の研究

いいえ

米国FDA規制機器製品の研究

いいえ

米国で製造され、米国から輸出された製品。

いいえ

この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。

購読する