不確実性三角測定による大規模言語モデルのスケーラブルな臨床監視 (SCOUT)
2026年2月14日 更新者:China National Center for Cardiovascular Diseases
大規模言語モデルの冠動脈疾患診断における出力に対するスケーラブルな臨床監視のためのモデル非依存メタ検証フレームワーク(SCOUT)の前向き評価:多読者・ランダム化・クロスオーバー試験
この前向き、多読者、ランダム化クロスオーバー試験は、SCOUT(Scalable Clinical Oversight via Uncertainty Triangulation)を評価します。これは、モデルに依存しないメタ検証フレームワークであり、3つの直交する不確実性シグナル(モデルの不均一性、確率的不一貫性、推論批判)を三角測量することで、信頼性の低い大規模言語モデル(LLM)の予測を選択的に臨床医に委ねます。
本試験は、冠動脈疾患(CHD)のサブタイプ分類において、診断精度を非劣性に維持しながら、SCOUT支援レビューが、AI生成診断の標準的な手動レビューと比較して医師のレビュー時間を短縮できるかどうかを評価します。
調査の概要
詳細な説明
背景:大規模言語モデルが臨床ワークフローに導入される機会が増えていますが、すべてのAI出力を臨床医が確認する必要があると、導入の動機である効率化の利点が失われます。 SCOUTは、アルゴリズム的メタ検証を通じて、この効率性と安全性のパラドックスに対処します。
SCOUTフレームワークは、3つの直交する外部信号を三角測量してケースレベルの不確実性を判定します:(1) モデル異質性 - 構造的に異なる補助LLMが主要モデルと一致するかどうか;(2) 確率的不整合性 - 同一モデルからの繰り返しサンプリングが異なる出力を生じるかどうか;(3) 推論批判 - 外部チェッカーモデルが連鎖思考推論の論理的欠陥を特定するかどうか。
このクロスオーバー試験では、異なる経験年数の7名の臨床医(ジュニアレジデント2名、シニアレジデント3名、主治医2名)が、標準的な手動レビューとSCOUT支援レビューワークフローの両方で、すべての110症例をそれぞれ確認します。 この研究は、ワークフロー効率(主要エンドポイント)と診断精度(副次エンドポイント)を評価します。
研究の種類
介入
入学 (推定)
7
段階
- 適用できない
連絡先と場所
このセクションには、調査を実施する担当者の連絡先の詳細と、この調査が実施されている場所に関する情報が記載されています。
研究連絡先
- 名前:Xiaojin Gao, Dr.
- 電話番号:+86 010 88322415
- メール:sophie_gao@sina.com
参加基準
研究者は、適格基準と呼ばれる特定の説明に適合する人を探します。これらの基準のいくつかの例は、人の一般的な健康状態または以前の治療です。
適格基準
就学可能な年齢
- 大人
- 高齢者
健康ボランティアの受け入れ
いいえ
説明
包含基準:
- 阜外医院の認定専門医または研修中の循環器専門医
- 3つの経験階層にわたる:ジュニアレジデント、シニアレジデント、主治医
除外基準:
- SCOUTフレームワークの開発または最適化に関与した臨床医
- ゴールドスタンダード裁定プロセスに関与した臨床医
研究計画
このセクションでは、研究がどのように設計され、研究が何を測定しているかなど、研究計画の詳細を提供します。
研究はどのように設計されていますか?
デザインの詳細
- 主な目的:診断
- 割り当て:ランダム化
- 介入モデル:クロスオーバー割り当て
- マスキング:なし(オープンラベル)
武器と介入
参加者グループ / アーム |
介入・治療 |
|---|---|
|
アクティブコンパレータ:対照(標準手動レビュー)
医師は、AIの予測と推論にアクセスしながら、対照群(n=54)の全症例を手動で確認します。
選択的な延期はありません。
|
医師は、AIモデルの予測と推論にアクセス可能な生の医療記録を使用して、SCOUTの不確実性層別化または選択的延期なしに、54症例の完全な手動レビューを行います。
|
|
実験的:実験的(SCOUT支援レビュー)
医師はSCOUTフレームワークを通じて介入セット(n=56)を処理します。
低い不確実性の症例は自動的に承認され、高い不確実性の症例は完全な監査証跡を伴う医師のレビューを受けます。
|
SCOUT支援レビュー(介入群):医師はSCOUTフレームワークで処理された56症例をレビューします。
低不確実性(D(x)=0)と分類された症例では、AIの予測は医師のレビューなしで自動承認されます。
高不確実性症例(D(x)=1)では、医師はメインモデルの連鎖思考推論とメタ検証監査結果にアクセスしながら症例をレビューします。
メインモデルは連鎖思考プロンプティングを備えたDeepSeek-V3.1です。
|
この研究は何を測定していますか?
主要な結果の測定
結果測定 |
メジャーの説明 |
時間枠 |
|---|---|---|
|
症例ごとの平均医師レビュー時間(分)
時間枠:研究完了まで、平均2時間。
|
各群における症例ごとの診断決定の見直しおよび判断に要した各臨床医の平均所要時間。
測定単位は分。 |
研究完了まで、平均2時間。
|
二次結果の測定
結果測定 |
メジャーの説明 |
時間枠 |
|---|---|---|
|
診断精度(%)
時間枠:研究完了まで、平均2時間。
|
各アームにおける正しいCHDサブタイプ分類(STEMI、NSTEMI、不安定狭心症、慢性冠症候群)の割合。
|
研究完了まで、平均2時間。
|
|
計算的投資収益率(ROI)
時間枠:研究完了まで、平均2時間。
|
医師の時間節約比率(三明医療改革ベンチマークの標準化された分単位賃金で評価)とSCOUT推論の計算コストの比率を、臨床医の経験年数別に層別化。
|
研究完了まで、平均2時間。
|
協力者と研究者
ここでは、この調査に関係する人々や組織を見つけることができます。
研究記録日
これらの日付は、ClinicalTrials.gov への研究記録と要約結果の提出の進捗状況を追跡します。研究記録と報告された結果は、国立医学図書館 (NLM) によって審査され、公開 Web サイトに掲載される前に、特定の品質管理基準を満たしていることが確認されます。
主要日程の研究
研究開始 (推定)
2026年2月19日
一次修了 (推定)
2026年2月28日
研究の完了 (推定)
2026年2月28日
試験登録日
最初に提出
2026年2月9日
QC基準を満たした最初の提出物
2026年2月14日
最初の投稿 (実際)
2026年2月17日
学習記録の更新
投稿された最後の更新 (実際)
2026年2月17日
QC基準を満たした最後の更新が送信されました
2026年2月14日
最終確認日
2026年2月1日
詳しくは
本研究に関する用語
個々の参加者データ (IPD) の計画
個々の参加者データ (IPD) を共有する予定はありますか?
はい
IPD プランの説明
本研究で報告された結果の基礎となる非識別化された個人参加者データは、利用可能となります。
IPD 共有時間枠
主要結果の公表から1ヵ月後から開始し、最大60ヵ月間利用可能です。
IPD 共有アクセス基準
データは、合理的な要求に基づき、対応する著者から入手可能です。
要求者は、方法論的に適切な研究計画を提供し、データ使用契約に署名する必要があります。
IPD 共有サポート情報タイプ
- STUDY_PROTOCOL
- SAP
- ICF
- ANALYTIC_CODE
- CSR
医薬品およびデバイス情報、研究文書
米国FDA規制医薬品の研究
いいえ
米国FDA規制機器製品の研究
いいえ
この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。