腎臓病学試験におけるAIからのフィードバックを用いた推論強化 (REFINe)
腎臓病学における生成AIからのフィードバックを用いた推論向上(REFINe):腎臓病学診断における生成AIサポートのランダム化評価
この臨床試験の目的は、人工知能(AI)が腎臓医学における医師の診断をどのように支援できるかを学ぶことです。 研究者は、大規模言語モデル(LLM)と呼ばれるAIツールが、医師がより頻繁に正しい診断を選択し、自分の回答により自信を持てるようになるかどうかを知りたいと考えています。
研究開始前、研究チームは複数のAIモデルをテストし、最高の性能を示すモデルの1つである、高度な推論努力を使用するように設定されたGPT-5クラスのモデルを選択しました。
この研究が答えようとする主な質問は以下の通りです:
- 医師はAIの提案を見ることができる場合、より多くの正しい診断を行うか?
- AIの提案を見ることは、医師が自分の診断に対して感じる自信を変えるか?
研究者は、AIの提案を受ける医師と受けない医師を比較し、AIが正確性、自信、意思決定にどのような影響を与えるかを調査します。
参加者は最大10件のオンライン臨床ケースを完了します。 各ケースについて、参加者は以下のことを行います:
- 短い医療シナリオを読む
- 最大3つの可能な診断を提案する
(AIグループの場合)AIの提案を確認し、回答を変更するかどうかを決定する
この研究では、参加者が各ケースに回答するのにかかる時間や、AIの性能が人間の回答と比較してどうであるかも調査します。
調査の概要
詳細な説明
本研究では、臨床医に高度推論大規模言語モデル(GPT-5)からのリアルタイム診断提案を提供することが、腎臓学臨床事例を解決する際の診断精度、確信度、効率性を改善するかどうかを評価します。 試験で使用するモデルを選択する前に、研究チームはパイロットセットの腎臓学症例を用いて、GPT-5、GPT-5-mini、O3、GPT-4o、Llama-4 Maverick-17B、Gemini-2.5-Pro、Qwen-3 VL-235B Thinking、DeepSeek-V3.2-Exp、MedGEMMA-27B、Claude Sonnet-4.5、Magistral-Medium-2509など、いくつかの最先端モデルをベンチマークしました。 GPT-5(高度推論)は最も高い診断性能、安定性、解釈可能性を示し、介入群で使用されるAIシステムとして選択されました。
参加者には、医学生、研修医、フェロー、開業医が含まれます。 アカウント作成後、参加者は人口統計学的質問票(専門分野、経験年数、診療形態、年齢層、AIへの親和性)を完了し、事例にアクセスする前に、これらのデータを研究目的で使用することに明示的に同意する必要があります。 直接的な個人識別情報は収集されません。
参加者は(専門的地位による層別化を行い)AI支援群または対照群のいずれかに無作為に割り付けられます。 各参加者にはフランス語または英語の腎臓学事例10件が割り当てられ、複数のセッションにわたって完了することができます。 事例を提出すると、再確認することはできません(「バックトラッキングなし」)。 事例ごとの所要時間は自動的に記録されます。
対照群
参加者は各事例を閲覧し、最大3つの診断(「Top-3」)を提供し、その後確信度評価(0-10)を行います。
AI支援群
参加者はまず、AI支援なしで初期のTop-3診断と確信度評価を入力します。 その後、システムはGPT-5の診断提案を表示し、参加者は診断を一度修正することができます。 事例は提出後にロックされます。
本研究では以下を収集します:
- 初期および最終診断、
- AI提案前および(該当する場合)後の確信度評価、
- 所要時間、
- 参加者の人口統計学的変数、
- およびAIモデル自身の診断出力。
部分的な完了は許可されます;完了したすべての事例は分析に貢献します。
主要および副次的評価項目には、診断精度(Top-3およびTop-1)、AI前後の精度改善、診断確信度の変化、AI誘発診断エラー、人間対AIベンチマーク、所要時間効率性指標、割り当てられた事例の完了割合が含まれます。
主要分析では、対照群(医師のみ)と実験群(AIモデル支援を受けた医師)の間の診断精度を比較します。 精度は二値アウトカム(正しい診断 vs 誤った診断)として分析されます。 各参加者が複数の臨床事例を評価するため、精度は、研究群の固定効果と参加者および事例の両方に対するランダム切片を持つ混合効果ロジスティック回帰を用いてモデル化されます。 このアプローチは、クラスタリングと事例間の難易度の変動を考慮します。 主要仮説検定では両側α = 0.05を使用します。 効果量はオッズ比と95%信頼区間として報告されます。 副次的分析では、交互作用項を用いて、精度が人口統計学的要因(例:経験レベル、専門分野)によって変動するかどうかを探ります。
各参加者が複数の事例を評価するため、チームはまた、参加者内ICCを0.10と仮定し、参加者および事例の両方に対するランダム切片を持つ混合効果ロジスティック回帰モデルを用いたシミュレーションベースの検出力分析を実施しました。 これらの仮定の下で、参加者100名(各群50名)、参加者あたり10事例の合計サンプルは、診断精度の臨床的に意味のある改善を検出するために>99%の検出力を提供します。 したがって、研究者は全体で約100名の参加者を登録することを計画しています。
本研究は、臨床医が複雑な腎臓学症例を評価する際に、AI拡張推論が診断性能と意思決定を意味的に改善するかどうかを定量化することを目的としています。
研究の種類
入学 (推定)
段階
- 適用できない
連絡先と場所
研究連絡先
- 名前:Raphaël BENTEGEAC, MD, MPH
- 電話番号:+33651204000
- メール:raphael.bentegeac@univ-lille.fr
研究場所
-
-
-
Lille、フランス、59000
- 募集
- Lille University Hospital (online study)
-
コンタクト:
- Raphaël BENTEGEAC, MD, MPH
- 電話番号:+33651204000
- メール:raphael.bentegeac@chu-lille.fr
-
コンタクト:
- Aghiles HAMROUN, MD, PhD
- メール:aghiles.hamroun@univ-lille.fr
-
-
参加基準
適格基準
就学可能な年齢
- 大人
- 高齢者
健康ボランティアの受け入れ
説明
参加基準:
18歳以上の成人。
英語またはフランス語で臨床事例を読み、回答できること。
インターネット接続可能なコンピューターまたはスマートフォンへのアクセス。
オンラインでのインフォームドコンセントの提供。
参加者は少なくとも基礎的な医学的訓練を受けていることが期待されます(例:医学生、研修医、フェロー、または臨床医)が、正式な確認は必要ありません。
除外基準:
18歳未満の個人。
オンライン研究手順を完了できないこと。
本研究で使用されるAIシステムの設計、開発、または評価への以前の関与。
研究計画
研究はどのように設計されていますか?
デザインの詳細
- 主な目的:診断
- 割り当て:ランダム化
- 介入モデル:並列代入
- マスキング:なし(オープンラベル)
武器と介入
参加者グループ / アーム |
介入・治療 |
|---|---|
|
実験的:AI提案付きグループ
このアームの参加者は、対照群と同じ臨床症例ビネットを完了します。
各症例について、参加者は内部ベンチマーク後に選択された大規模言語モデル(GPT-5、高推論構成)によって生成された提案診断を受け取ります。
参加者は、自身の最終的な診断回答を入力する前に、AIの提案を確認することができます。
追加情報、プロンプト、またはコーチングは提供されません。
介入は、症例解決タスク中にAI生成の診断提案を表示することのみで構成されます。
|
この介入は、臨床事例解決タスク中にAI生成の診断提案を表示することから構成されます。
各事例を読んだ後、参加者は内部ベンチマーク後に選択された大規模言語モデル(GPT-5、高推論構成)によって生成されたトップ診断提案を見ます。
AI提案は事例ごとに1回表示され、再リクエストや修正はできません。
参加者は提案を見た後に診断回答を修正できますが、後で事例に戻ることはできません。
追加のガイダンス、コーチング、またはインタラクティブ機能は提供されません。
|
|
介入なし:AI提案なしのグループ
このアームの参加者は、AIが生成した診断提案なしに、臨床症例ビネットを独立して完了します。
彼らは各ビネットを読み、提示された情報のみに基づいて独自の診断回答を提供します。
外部の意思決定支援や追加資料は提供されません。
|
この研究は何を測定していますか?
主要な結果の測定
結果測定 |
メジャーの説明 |
時間枠 |
|---|---|---|
|
AIサポートありとなしの最終診断精度(上位3)
時間枠:最初のビネット回答から研究終了まで(最長12か月)。
|
各参加者について、参加者の最終的な上位3つの診断に正しい主診断が含まれているビネットの割合。 AI群(AI提案後)と対照群(AIなし)の間で、最終的な上位3つの診断精度を比較します。 正しく診断された症例の割合(上位3つ)。 |
最初のビネット回答から研究終了まで(最長12か月)。
|
二次結果の測定
結果測定 |
メジャーの説明 |
時間枠 |
|---|---|---|
|
AIサポートあり対なしの最終診断精度(top-1)
時間枠:最初のビネットへの回答から研究終了まで(最大12か月)。
|
各参加者について、参加者の最終的なトップ1診断に正しい主診断が含まれているビネットの割合。
AI群(AI提案後)と対照群(AIなし)の最終的なトップ1診断の精度を比較。
正しく診断された症例の割合(トップ1)。
|
最初のビネットへの回答から研究終了まで(最大12か月)。
|
|
AI提案前後の上位3診断精度の変化(AI群のみ)
時間枠:最初のビネット回答から研究終了まで(最長12か月)。
|
AI支援群では、参加者はまずAIの提案なしで初期回答(最大3つの診断)を提供し、その後AIが生成した提案を見て回答を1回修正することができます。その後、そのビネットに戻ることはできません。 各参加者について、調査員は完了したすべてのビネットにおける初期回答と最終回答の間のトップ3診断精度の差を計算します。 トップ3診断精度のパーセンテージポイント変化 |
最初のビネット回答から研究終了まで(最長12か月)。
|
|
AI提案前後のトップ1診断精度の変化(AI群のみ)
時間枠:最初のビネットが回答されてから研究終了まで(最長12ヶ月)。
|
AI支援群では、参加者はまずAIの提案なしで初期回答(最大3つの診断)を提供し、その後AI生成の提案を見て回答を一度だけ修正できる。その後、そのビネットに戻ることはできない。 各参加者について、調査者は完了したすべてのビネットにおける初期回答と最終回答のトップ1精度の差を計算する。 トップ1診断精度のパーセンテージポイント変化 |
最初のビネットが回答されてから研究終了まで(最長12ヶ月)。
|
|
AI提案前の診断確信度(0-10):対照群 vs AI群
時間枠:最初のビネットへの回答から研究終了まで(最長12ヶ月)。
|
両群の参加者は、AIによる提案が示される前に、自身の上位3つの診断提案に対する確信度(0~10段階)を評価します。 AI群では、これは「AI前」評価となります。 対照群では、これは単一の確信度評価となります(AIが表示されないため)。 研究者は、参加者ごとの全完了ビネットを集計した、群間のAI前確信度を比較します。 |
最初のビネットへの回答から研究終了まで(最長12ヶ月)。
|
|
AI提案後の最終診断確信度(0-10):対照群 vs AI群
時間枠:最初のビネットに回答してから研究終了まで(最長12か月間)。
|
すべての完了したビネットにおける上位3つの診断提案に対する最終的な診断信頼度(0-10スケール)を、群間で比較したものです。 AI群では、これはAI後の信頼度評価です。 対照群では、これは同じ信頼度評価です(参加者はAI提案を受け取りません)。 |
最初のビネットに回答してから研究終了まで(最長12か月間)。
|
|
AI提案前後の診断確信度の変化(0-10)(AI群のみ)
時間枠:最初のビネットが回答されてから研究終了まで(最大12か月)。
|
AI群では、参加者はAIの提案を見る前と見た後の両方で、上位3つの診断に対する確信度評価(0〜10段階)を提供します。 各参加者について、研究者は完了した全ての症例シナリオにわたって参加者内の変化(AI後マイナスAI前)を計算します。 確信度スコアの変化(0〜10段階) |
最初のビネットが回答されてから研究終了まで(最大12か月)。
|
|
AI誘発診断エラー(AI群のみ)
時間枠:最初のビネット回答から研究終了まで(最長12ヶ月間)。
|
参加者の初期Top-1診断が正しい完了したビネットのうち、AI提案後に最終Top-1診断が不正解になる割合。
|
最初のビネット回答から研究終了まで(最長12ヶ月間)。
|
|
AI提案後の上位3診断の変化(AI群のみ)
時間枠:最初のビネットに回答した時点から研究終了まで(最長12ヶ月)。
|
AI群で完了した小試験において、AI導入前と導入後の回答で上位3つの診断が異なる割合。
|
最初のビネットに回答した時点から研究終了まで(最長12ヶ月)。
|
|
トップ3診断精度:AI以前の全人間回答 vs AI精度
時間枠:最初のビネットに回答してから研究終了まで(最長12か月)。
|
各ビネットについて、AI提案前の人間参加者のトップ3診断精度(両研究群の参加者をAI前段階で統合)を、同じビネットに対するAIモデルのトップ3診断精度と比較します。 報告されるアウトカムは精度差であり、AIトップ3精度から人間AI前トップ3精度を引いたものとして定義され、パーセンテージポイントで表され、完了した全ビネットにわたってビネットレベルで計算されます。 トップ3診断精度のパーセンテージポイント差 |
最初のビネットに回答してから研究終了まで(最長12か月)。
|
|
トップ3診断精度:AI vs AI精度後の人間による最終回答(AI群のみ)
時間枠:最初のビネットが回答されてから研究終了まで(最大12か月)。
|
AI支援群で完了した各ビネットについて、AI提案を閲覧した後の人間参加者のTop-3診断精度が、AIモデルのTop-3診断精度と比較されます。 (Top-3精度は単一の測定値です)報告されたアウトカムは精度差であり、AI Top-3精度から人間のAI後Top-3精度を引いたものとして定義され、パーセンテージポイントで表され、AI群で完了したすべてのビネットにわたってビネットレベルで計算されます。 AIと人間の間のTop-3診断精度のパーセンテージポイント差 |
最初のビネットが回答されてから研究終了まで(最大12か月)。
|
|
AIサポートありとなしでの各ビネットの完了時間
時間枠:最初のビネット回答から研究終了まで(最大12か月)。
|
各ビネットについて、プラットフォームはビネットの開始から回答の提出までの時間を記録します。 対照群では、各ビネットに対して単一の完了時間が記録されます。 AI支援群では、AI提案を閲覧する前と閲覧した後の完了時間が記録されます。 アウトカムは、研究群間の完了時間の差を報告し、秒単位で表され、すべての完了したビネットにわたって計算されます。 秒(完了時間の差) |
最初のビネット回答から研究終了まで(最大12か月)。
|
|
割り当てられたビネットの完了割合
時間枠:最初のビネットへの回答から研究終了まで(最大12か月間)。
|
各参加者について、研究期間中に完了した10件のビネットの割合を、群間で比較する。
|
最初のビネットへの回答から研究終了まで(最大12か月間)。
|
協力者と研究者
研究記録日
主要日程の研究
研究開始 (実際)
一次修了 (推定)
研究の完了 (推定)
試験登録日
最初に提出
QC基準を満たした最初の提出物
最初の投稿 (実際)
学習記録の更新
投稿された最後の更新 (実際)
QC基準を満たした最後の更新が送信されました
最終確認日
詳しくは
本研究に関する用語
追加の関連 MeSH 用語
その他の研究ID番号
- CHUL-191125
医薬品およびデバイス情報、研究文書
米国FDA規制医薬品の研究
米国FDA規制機器製品の研究
この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。