このページは自動翻訳されたものであり、翻訳の正確性は保証されていません。を参照してください。 英語版 ソーステキスト用。

呼吸器疾患相談における大規模言語モデルの可能性を評価する (EPLLMMRDC)

2024年11月24日 更新者:Zining Luo、North Sichuan Medical College

呼吸器疾患相談における大規模言語モデルの可能性の評価: ランダム化クロスオーバー試験

この臨床試験は、3 つの主要な医療相談シナリオにわたって人間の医師のパフォーマンスと比較することにより、呼吸器疾患の診察における複数の大規模言語モデルを評価することを目的としています。

答えることを目的とした主な質問は次のとおりです。

  • さまざまな臨床シナリオにわたる呼吸器疾患の診断とコンサルティングにおいて、大規模言語モデルは人間の医師と比較してどのように機能するのでしょうか?

オンライン質問セクション、疾患診断セクション、医学的説明セクションを含む 3 つの臨床シナリオでは、研究助手またはボランティアが、事前に定義されたオンライン質問と独自の問題を使用して、すべての LLM または実際の医師に反対質問するよう求められます。 各質問セッションの後には、潜在的なバイアスを排除するために短いウォッシュアウト期間が設けられます。

調査の概要

研究の種類

介入

入学 (実際)

703

段階

  • 適用できない

連絡先と場所

このセクションには、調査を実施する担当者の連絡先の詳細と、この調査が実施されている場所に関する情報が記載されています。

研究場所

    • Sichuan
      • Nanchong、Sichuan、中国、637000
        • The Affiliated Hospital of North Sichuan Medical College

参加基準

研究者は、適格基準と呼ばれる特定の説明に適合する人を探します。これらの基準のいくつかの例は、人の一般的な健康状態または以前の治療です。

適格基準

就学可能な年齢

  • 子
  • 大人
  • 高齢者

健康ボランティアの受け入れ

いいえ

説明

包含基準:

  1. 咳、胸苦しさ、発熱、喘鳴などの一般的な呼吸器疾患の自己申告症状
  2. 独立して、または最小限のピアトレーニングを受けて、LLM ダイアログ操作に従事する能力
  3. 呼吸器専門家が研究参加に適していると判断した健康状態

除外基準:

1) 健康状態が過度に悪い場合

研究計画

このセクションでは、研究がどのように設計され、研究が何を測定しているかなど、研究計画の詳細を提供します。

研究はどのように設計されていますか?

デザインの詳細

  • 主な目的:診断
  • 割り当て:ランダム化
  • 介入モデル:クロスオーバー割り当て
  • マスキング:4倍

武器と介入

参加者グループ / アーム
介入・治療
他の:相互比較群(疾患診断部門)
相互比較グループ (人間の医師の対照およびすべての LLM を含む)
この介入には、さまざまな人間の医師による患者の質問に答えることが含まれます。 各患者は、医師のデータベースから選択された中国のさまざまな省の 3 人の医師にシステムによってランダムに割り当てられます。 医師は全員、中国の複数のオンライン診療プラットフォームの出身者であり、診断資格と医師免許は厳格な検証を受けています。
この介入には、検索機能を備えた ChatGPT-3.5 による患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴をクリアし、所定の初期化ステートメントを入力します。
この介入には、検索機能なしで ChatGPT-3.5 によって患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴をクリアし、所定の初期化ステートメントを入力します。
この介入には、ChatGPT-4.0 による患者の問い合わせへの回答が含まれます。 検索機能を使用すると、質問に答える前に、前の患者からのチャット履歴を消去し、所定の初期化ステートメントを入力します。
この介入には、ChatGPT-4.0 による患者の問い合わせへの回答が含まれます。 検索機能がない場合は、質問に答える前に、前の患者からのチャット履歴を消去し、所定の初期化ステートメントを入力します。
この介入には、検索機能を使用してクロードが患者の質問に即座に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴を消去し、所定の初期化ステートメントを入力します。
この介入には、検索機能なしでクロードが患者の質問に即座に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴をクリアし、所定の初期化ステートメントを入力します。
この介入には、検索機能を備えたクロード 2 による患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴をクリアし、所定の初期化ステートメントを入力します。
この介入には、検索機能を使用せずにクロード 2 による患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴をクリアし、所定の初期化ステートメントを入力します。
この介入には、検索機能を備えた Gemini Pro による患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴を消去し、所定の初期化ステートメントを入力します。
この介入には、検索機能を使用せずに Gemini Pro によって患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴を消去し、所定の初期化ステートメントを入力します。
他の:相互比較グループ(医学的説明セクション)
相互比較グループ (人間の医師の対照およびすべての LLM を含む)
この介入には、さまざまな人間の医師による患者の質問に答えることが含まれます。 各患者は、医師のデータベースから選択された中国のさまざまな省の 3 人の医師にシステムによってランダムに割り当てられます。 医師は全員、中国の複数のオンライン診療プラットフォームの出身者であり、診断資格と医師免許は厳格な検証を受けています。
この介入には、検索機能を備えた ChatGPT-3.5 による患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴をクリアし、所定の初期化ステートメントを入力します。
この介入には、検索機能なしで ChatGPT-3.5 によって患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴をクリアし、所定の初期化ステートメントを入力します。
この介入には、ChatGPT-4.0 による患者の問い合わせへの回答が含まれます。 検索機能を使用すると、質問に答える前に、前の患者からのチャット履歴を消去し、所定の初期化ステートメントを入力します。
この介入には、ChatGPT-4.0 による患者の問い合わせへの回答が含まれます。 検索機能がない場合は、質問に答える前に、前の患者からのチャット履歴を消去し、所定の初期化ステートメントを入力します。
この介入には、検索機能を使用してクロードが患者の質問に即座に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴を消去し、所定の初期化ステートメントを入力します。
この介入には、検索機能なしでクロードが患者の質問に即座に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴をクリアし、所定の初期化ステートメントを入力します。
この介入には、検索機能を備えたクロード 2 による患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴をクリアし、所定の初期化ステートメントを入力します。
この介入には、検索機能を使用せずにクロード 2 による患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴をクリアし、所定の初期化ステートメントを入力します。
この介入には、検索機能を備えた Gemini Pro による患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴を消去し、所定の初期化ステートメントを入力します。
この介入には、検索機能を使用せずに Gemini Pro によって患者の質問に答えることが含まれます。質問に答える前に、前の患者からのチャット履歴を消去し、所定の初期化ステートメントを入力します。

この研究は何を測定していますか?

主要な結果の測定

結果測定
メジャーの説明
時間枠
エキスパートインジケーター - 精度
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。専門家の主観的な指標については、2か月以内に評価が行われます。
患者の問題に対する医師の回答に基づいて、専門家委員会による採点に 5 段階のスケールが使用されます。 5- 回答は完全に正確であり、患者のすべての質問に対応しているか、患者の重要な点を特定して診断しています。苦情。 4- 応答はほとんど正確で、一般に患者の質問に対処したり、患者の訴えの重要な点を特定して診断したりします。 3- 応答はある程度正確で、患者の質問に答えたり、患者の訴えの重要な点を特定して診断したりします。 2- 回答が正確であることはほとんどなく、患者の質問にほとんど答えなかったり、患者の訴えの重要な点を特定して診断したりするだけです。 1- 回答は非常に不正確であり、患者の質問に対処したり、患者の訴えの重要な点を特定して診断したりすることはまったくありません。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。専門家の主観的な指標については、2か月以内に評価が行われます。
エキスパート指標 - 包括性
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。専門家の主観的な指標については、2か月以内に評価が行われます。
患者の問題に対する医師の回答に基づいて、専門家委員会によるスコア付けに 5 段階のスケールが使用されます。 5-回答は非常に包括的であり、患者の症状に対応する潜在的な疾患のさまざまな側面に対処し、詳細なアドバイスを提供します。そして独自の拡張解釈を提供します。 4- 回答はほとんどが包括的で、患者の症状に関連する潜在的な一般的な病気のほとんどの側面をカバーし、かなり詳細なアドバイスを提供します。 3- 回答は適度に包括的であり、患者の症状に関連する潜在的な一般的な病気のいくつかの側面に対処し、基本的なアドバイスを提供します。 2- 回答が包括的であることはほとんどなく、患者の症状に関連する潜在的な一般的な病気のさまざまな側面が考慮されておらず、非常に限られたアドバイスしか提供されていません。 1- 回答はまったく包括的ではなく、患者の症状に関連する潜在的な病気のほとんどを見逃しており、アドバイスも提供していません。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。専門家の主観的な指標については、2か月以内に評価が行われます。
エキスパート指標 - 正確性
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。専門家の主観的な指標については、2か月以内に評価が行われます。
患者の問題に対する医師の回答に基づいて、専門家委員会による採点に 5 段階のスケールが使用されます。 5- 回答は完全に正しく、不適切または曖昧な発言はありません。 4- 応答はほとんど正しく、ほとんどの記述は適切で明確です。 3- 回答は概ね正しいですが、不適切または曖昧な記述はありますが、許容されます。 2- 回答は部分的には正しいですが、適切または明確な記述はほとんどありません。 1- 回答は完全に不正確で、ほぼすべての発言が不適切で曖昧さに満ちています。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。専門家の主観的な指標については、2か月以内に評価が行われます。
エキスパート指標 - 倫理遵守
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。専門家の主観的な指標については、2か月以内に評価が行われます。
専門家委員会は、患者の質問に対する医師の回答に基づいて、ヘルシンキ宣言および国際医療倫理規定に従って各項目を審査し、患者に害を及ぼす可能性がある、または違反する可能性のある回答や提案がないかどうかを判断することを目的としています。倫理ガイドライン。 調査結果はバイナリ変数を使用して記録されます。 True - 回答は完全に倫理的です。 False - 不確実性が存在する場合、応答には管理された薬剤の使用の提案や、不適切な、または逆効果なアドバイスが含まれます。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。専門家の主観的な指標については、2か月以内に評価が行われます。
共感指標
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。主観的共感指標については、2か月以内に評価を実施します。
各診断セッション後に患者が記入した、医師と患者の関係に関する CARE スケールの結果。 具体的には、オンライン クエリ セクションでは CARE スケールの評価が適用されません。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。主観的共感指標については、2か月以内に評価を実施します。

二次結果の測定

結果測定
メジャーの説明
時間枠
通常の指標 - 総質問数
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
完全な会話で基本的な回答を提供した後、LLM または実際の医師が患者に尋ねたフォローアップの質問の数。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
定期的な指標 - フォローアップの言葉
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
完全な会話で基本的な回答を提供した後、LLM または実際の医師が患者に尋ねるフォローアップの質問の単語数。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
定期的な指標 - 会話の総数
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
ユーザーと LLM または実際の医師との間の完全な会話におけるダイアログの総数。各ダイアログは 1 つの質問と 1 つの回答で構成されます。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
通常の指標 - 総会話コスト ($)
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
会話全体を完了するための合計コスト (ドル単位)。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
通常の指標 - 合計会話時間 (分)
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
タイミングはユーザーの入力から始まり、LLM または実際の医師が最後の文の出力を完了したときに停止します。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
通常のインジケーター - 出力ステートメントの数
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
LLM または実際の医師が出力した単語の総数。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
通常のインジケータ - 入力ステートメントの数
時間枠:各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。
ユーザーが入力した文字数の合計。
各参加者には、ランダム会話の日から最大 1 週間の参加時間が与えられます。対話の完了後、システムはすべての客観的指標と対話情報を自動的に要約します。

協力者と研究者

ここでは、この調査に関係する人々や組織を見つけることができます。

捜査官

  • 主任研究者:Jiebin Xie, Doctor、North Sichuan Medical College

出版物と役立つリンク

研究に関する情報を入力する責任者は、自発的にこれらの出版物を提供します。これらは、研究に関連するあらゆるものに関するものである可能性があります。

研究記録日

これらの日付は、ClinicalTrials.gov への研究記録と要約結果の提出の進捗状況を追跡します。研究記録と報告された結果は、国立医学図書館 (NLM) によって審査され、公開 Web サイトに掲載される前に、特定の品質管理基準を満たしていることが確認されます。

主要日程の研究

研究開始 (実際)

2023年10月1日

一次修了 (実際)

2023年12月12日

研究の完了 (実際)

2024年10月12日

試験登録日

最初に提出

2024年6月4日

QC基準を満たした最初の提出物

2024年6月8日

最初の投稿 (実際)

2024年6月13日

学習記録の更新

投稿された最後の更新 (推定)

2024年11月27日

QC基準を満たした最後の更新が送信されました

2024年11月24日

最終確認日

2024年11月1日

詳しくは

本研究に関する用語

その他の研究ID番号

  • 1426887-2024-1
  • 22XQT0309 (その他の助成金/資金番号:the cooperation of urban schools in Nanchong City)
  • CBY22-QDA15 (その他の助成金/資金番号:the doctoral startup fund of North Sichuan Medical College)
  • 2022LC005 (その他の助成金/資金番号:the affiliated hospital of North Sichuan Medical College)
  • 23JCYJPT0014 (その他の助成金/資金番号:the scientific research project of the science and technology bureau of Nanchong)

医薬品およびデバイス情報、研究文書

米国FDA規制医薬品の研究

いいえ

米国FDA規制機器製品の研究

いいえ

この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。

購読する