このページは自動翻訳されたものであり、翻訳の正確性は保証されていません。を参照してください。 英語版 ソーステキスト用。

行動的ナッジを用いた医師-LLM診断推論における自動化バイアスの緩和

2026年6月24日 更新者:Ihsan Ayyub Qazi, PhD、Lahore University of Management Sciences

行動ナッジを用いた医師-LLM診断推論における自動化バイアスの軽減

この無作為化比較試験の目的は、ChatGPT-5.1のような大規模言語モデル(LLM)を臨床意思決定に使用する医師において、自動化バイアス(自動化された出力の無批判な受容)を行動ナッジが軽減できるかどうかを評価することです。

この試験が主に解明しようとしている疑問は以下の通りです:二重メカニズム行動ナッジ介入(ベースライン精度アンカリングと症例特異的な色分けされた信頼度シグナルの組み合わせ)は、医師の誤ったLLM推奨に対する無批判な受容を軽減するか?

研究者は、行動ナッジ付きのLLM推奨を受けた医師群と、ナッジなしでLLM推奨のみを受けた医師群を比較し、ナッジが自動化バイアスを軽減するかどうかを評価します。

参加者は以下の手順を行います:

  • LLM生成の推奨が付随する6つの臨床ビネットを評価します(うち半数は意図的で臨床的に重要な誤りを含む)。
  • 対照群:ナッジなしの標準形式でLLM推奨を閲覧できます。
  • 介入群:標準医療データセットにおけるChatGPTの診断精度を初期アンカーとして閲覧し、その後各推奨に色分けされた信頼度シグナル(例:低信頼度は赤色)を受け取ります。
  • 盲検化された評価者が専門家開発の評価ルーブリックを用いて回答を評価し、誤った情報に対する無批判な受容を検出します。

調査の概要

状態

完了

条件

詳細な説明

自動化バイアスは、現代の臨床実践における重要な課題であり、特に人工知能(AI)ツールが医療ワークフローにますます組み込まれる中で顕著です。 この認知現象は、臨床医が自動化された意思決定システムからの提案を、たとえそれらの提案が誤っていても優先する傾向を説明します。 ChatGPT-5.1などの大規模言語モデル(LLM)が医療現場で普及するにつれ、エラーを減らし効率を向上させる可能性は、重要な懸念と比較衡量する必要があります:これらのモデルは厳格な医学的検証を欠いており、誤ったまたは誤解を招く推奨を通じて既存の認知バイアスを増幅する可能性があります。

医療文脈における自動化バイアスの出現は、環境的要因と心理的要因の複雑な相互作用を反映しています。 高負荷の臨床現場における時間的制約は、適切な精査なしにAI生成の推奨を受け入れる圧力を生み出します。 徹底性よりも効率性を優先する経済的インセンティブは、適切な臨床判断に必要な批判的評価をさらに阻害する可能性があります。 長時間勤務中の認知的疲労は、医師の持続的分析的思考能力を低下させます。 これらの圧力は、責任の分散、技術的解決策への過信、認知的負荷軽減などの心理的メカニズムと相互作用し、AI生成の推奨を無批判に受け入れる可能性が高まる条件を集合的に生み出します。

このランダム化比較試験は、LLM生成の診断推奨を利用する医師の間で自動化バイアスを緩和するように設計された行動ナッジ介入の有効性を評価します。 主目的は、意図的に欠陥のあるLLM推奨を含む臨床ビネットを評価する際に、この介入が診断推論パフォーマンススコアを改善するかどうかを判断することです。 副次的目的には、医師の経験レベル、性別、および以前のLLM経験が介入の有効性を調整するかどうかの評価、異なる信頼シグナルにわたるビネットに対する差別的効果の決定が含まれます。

この研究は、2つの並行群を用いた単盲検ランダム化比較試験を採用します。 参加者は、介入群または対照群のいずれかに1:1でランダムに割り当てられます。 プロンプトスキルの違いによる変動を排除するため、参加者はライブLLMインターフェースと直接対話しません。 代わりに、すべての参加者は、事前生成されたLLM推奨付きの臨床ビネットを表示するカスタム構築のウェブプラットフォームを使用し、各ビネットに対して同一のLLM生成コンテンツを保証します。

すべての参加者は、約75分間の単一の監督付きセッション中に6つの臨床ビネットを評価します。 3つのビネットにはLLM推奨に意図的に導入された臨床推論の欠陥が含まれ、3つには正しい推奨が含まれます。 ビネットはパターン検出を防ぐためにランダムな順序で提示されます。

対照群の参加者は、追加の文脈情報なしで標準的な中立テキスト形式で提示されたChatGPTによって生成されたLLM診断推奨付きの臨床ビネットを評価します。 介入群の参加者は、行動ナッジとともに同じビネットを評価します。 この介入は、2つの同期化された認知キューで構成されます:(1)インターフェースパネルの上部にChatGPTの標準医療データセットにおけるベースライン診断精度を表示するアンカリングキューで、モデルの誤りやすさに対する期待を明示的に固定し、(2)LLM推奨とともに、アンサンブル評価を通じて生成された色分けされた信頼シグナルを表示する選択的注意キュー:3つの独立した最先端LLM(Claude Sonnet 4.5、Gemini 2.5 Pro Thinking、およびGPT-5.1)がそれぞれ推奨に対する信頼度評価を提供し、平均信頼度がシングルモデルの誤較正を緩和するために信号色を決定します。

色分けされた信頼シグナルは、ベースライン診断精度に対するアンサンブルの平均信頼度に基づいて、3つの異なるレベルに分類されます。 平均信頼度がChatGPTの確立されたベースライン精度を下回るときに赤信号が発動され、高度な批判的精査を要求する高不確実性ケースを明示的にフラグ付けします。 オレンジ信号は、平均信頼度がベースライン平均を超えているが100%未満であることを示し、継続的な臨床的警戒と慢心の回避の必要性を信号します。 最後に、緑信号は100%アンサンブル合意のインスタンスに限定されます;ただし、このレベルの信頼度であっても、システムの出力への過度の依存を防ぐために標準のAI安全警告が残ります。

参加者には、自動化バイアスを測定するために特別に設計された6つの臨床ビネットが提示されます。これらは、診断難易度の範囲と一般的な医学専門分野を代表する実際の症例から収集および修正されたものです。 各ビネットは、主訴、現病歴、関連する既往歴/社会的/家族歴、身体所見、および初期検査結果を含む標準化されたフォーマットに従います。

主アウトカムは、診断推論パフォーマンススコアです。これは、鑑別診断の質、支持所見、反対所見、最終診断の正確性、および次のステップの適切性を評価する構造化ルーブリックに基づく複合パーセンテージスコアです。 副次アウトカムには、トップ選択診断の正確性(誤り、部分的に正しい、または正しい)が含まれます。 すべての回答は、盲検化された評価者が評価ルーブリックを使用して評価します。

研究の種類

介入

入学 (実際)

72

段階

  • 適用できない

連絡先と場所

このセクションには、調査を実施する担当者の連絡先の詳細と、この調査が実施されている場所に関する情報が記載されています。

研究場所

    • Punjab Province
      • Lahore、Punjab Province、パキスタン、54792
        • Lahore University of Management Sciences

参加基準

研究者は、適格基準と呼ばれる特定の説明に適合する人を探します。これらの基準のいくつかの例は、人の一般的な健康状態または以前の治療です。

適格基準

就学可能な年齢

  • 大人
  • 高齢者

健康ボランティアの受け入れ

はい

説明

参加基準:

  • パキスタン医療歯科評議会(PMDC)に完全または仮登録されている医療従事者。
  • 医学士・外科学士(MBBS)試験を修了していること。 米国およびカナダにおけるMBBSに相当する学位は医学博士(MD)です。
  • 参加者は、ChatGPT(または同等の大規模言語モデル)の使用に関する構造化されたトレーニングプログラムを少なくとも10時間の指導時間で修了している必要があります。 プログラムには、特にプロンプトエンジニアリングとコンテンツ評価に関するLLMの主要な側面に関連する実践的な演習を含める必要があります。

除外基準:

  • PMDCに登録されているその他の医療従事者(完全または仮登録、例:歯学士(BDS)の学位を持つ専門家)。

研究計画

このセクションでは、研究がどのように設計され、研究が何を測定しているかなど、研究計画の詳細を提供します。

研究はどのように設計されていますか?

デザインの詳細

  • 主な目的:診断
  • 割り当て:ランダム化
  • 介入モデル:並列代入
  • マスキング:独身

武器と介入

参加者グループ / アーム
介入・治療
アクティブコンパレータ:ChatGPTの推奨事項と行動ナッジを組み合わせて
参加者は6つの臨床症例を評価します。 試験中、参加者は従来の診断リソースに加えて、特定の商用LLM(ChatGPT)からの臨床推奨にアクセスできます。 3つの症例に対するLLMの推奨には意図的に誤った診断情報が含まれ、3つの症例には正確な推奨が含まれます。 症例はランダムな順序で提示されます。 このグループの参加者は、LLM推奨インターフェースに埋め込まれた行動ナッジを受け取り、LLMパネルが展開されるときに2つの同期した認知的キューが表示されます:(1) パネルの上部にChatGPTの標準医療データセットにおけるベースライン診断精度を表示するアンカリングキュー(現実的な期待を設定するため)、その直下に位置するキュー介入(LLM推奨と症例固有の色分けされた信頼度信号を一緒に表示)。
治療群の参加者は、LLM推奨インターフェースに組み込まれた行動ナッジ介入を受けます。これは、LLMパネルが展開されたときに2つの同期した認知キューを提示します:(1) パネルの上部にChatGPTの標準医療データセットにおけるベースライン診断精度を表示するアンカリングキューで、具体的な推奨事項を閲覧する前に現実的な期待値を設定します。(2) 直下に配置される選択的注意キューで、LLMの推奨事項とともにケース固有の色分けされた信頼度シグナルを表示します。 このシグナルは、平均アンサンブル信頼度が確立されたベースライン精度を下回る場合は赤(高い不確実性を示し、批判的評価を要するケース)、信頼度がベースライン以上だが100%未満の場合はオレンジ(自己満足を防ぎ、積極的な臨床的審査を維持するため)、100%のアンサンブル合意の場合は緑に分類されます(ただし、標準的な注意警告は依然として適用され、警戒を怠りません)。
介入なし:行動ナッジなしのChatGPT推奨事項
参加者は6つの臨床事例を評価します。 試験期間中、従来の診断リソースに加えて、特定の市販LLM(ChatGPT)からの臨床的推奨事項にアクセスできます。 3つの事例に対するLLMの推奨事項には、意図的に欠陥のある診断情報が含まれます。 事例はランダムな順序で提示されます。 このグループの参加者は、行動的なナッジを受けません。

この研究は何を測定していますか?

主要な結果の測定

結果測定
メジャーの説明
時間枠
診断推論精度スコア
時間枠:各ケースについて、参加者登録後0~5日間に実施される予定の診断推論評価セッション中に、単一の時点で評価されます。
主要評価項目は、各症例における0%から100%までの正答率であり、スコアが高いほど診断性能が優れていることを示します。 各症例について、参加者は3つの主要診断、各診断を支持する所見、および各診断に反する所見を回答します。 それぞれの妥当な診断に対して、参加者は1ポイントを獲得します。 診断を支持する所見および診断に反する所見についても、正確性に基づいて採点され、各正答に対して1ポイントが付与されます。 次に、参加者は最も可能性が高いと考える最優先診断を回答し、妥当な回答に対して9ポイント、最も正確な回答に対して18ポイントを獲得します。 最後に、参加者は患者をさらに評価するための最大3つの次のステップを回答し、部分的に正しい回答に対して0.5ポイント、完全に正しい回答に対して1ポイントが付与されます。 主要評価項目は、無作為化群間で症例レベルで比較されます。
各ケースについて、参加者登録後0~5日間に実施される予定の診断推論評価セッション中に、単一の時点で評価されます。

二次結果の測定

結果測定
メジャーの説明
時間枠
トップ選択診断精度スコア
時間枠:各ケースについて単一の時点で評価され、参加者登録後0~5日間に実施される予定の診断推論評価セッション中に行われます。
副次評価項目は、各臨床事例について最も可能性の高い診断を特定する参加者のパフォーマンスを測定します。 各症例を評価した後、参加者は単一の最も可能性の高い診断を選択します。これは事前に設定された3段階診断精度スケールで採点されます:最も正確な診断には18点、臨床的に妥当な代替診断には9点、誤った診断には0点が与えられます。 各参加者について、最優先診断精度スコアは(獲得総点÷最大可能点)×100として計算され、0〜100%の範囲で表され、高いスコアはより優れた診断精度を示します。 このパーセンテージスコアは、無作為化群間で症例レベルで比較され、自動化バイアスが診断意思決定に与える影響を定量化します。
各ケースについて単一の時点で評価され、参加者登録後0~5日間に実施される予定の診断推論評価セッション中に行われます。

協力者と研究者

ここでは、この調査に関係する人々や組織を見つけることができます。

捜査官

  • 主任研究者:Muhammad Asadullah Khawaja, MBBS、King Edward Medical University
  • 主任研究者:Ihsan Ayyub Qazi, PhD、Lahore University of Management Sciences (LUMS)
  • 主任研究者:Ali Zafar Sheikh, MBBS、Lahore General Hospital
  • 主任研究者:Muhammad Junaid Akhtar, MBBS、Children's Hospital, Lahore
  • 主任研究者:Muhammad Hamad Alizai, PhD、Lahore University of Management Sciences (LUMS)

研究記録日

これらの日付は、ClinicalTrials.gov への研究記録と要約結果の提出の進捗状況を追跡します。研究記録と報告された結果は、国立医学図書館 (NLM) によって審査され、公開 Web サイトに掲載される前に、特定の品質管理基準を満たしていることが確認されます。

主要日程の研究

研究開始 (実際)

2026年1月17日

一次修了 (実際)

2026年5月25日

研究の完了 (実際)

2026年5月26日

試験登録日

最初に提出

2025年12月26日

QC基準を満たした最初の提出物

2025年12月26日

最初の投稿 (実際)

2026年1月9日

学習記録の更新

投稿された最後の更新 (実際)

2026年6月25日

QC基準を満たした最後の更新が送信されました

2026年6月24日

最終確認日

2026年6月1日

詳しくは

本研究に関する用語

個々の参加者データ (IPD) の計画

個々の参加者データ (IPD) を共有する予定はありますか?

いいえ

医薬品およびデバイス情報、研究文書

米国FDA規制医薬品の研究

いいえ

米国FDA規制機器製品の研究

いいえ

この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。

購読する