AI医療面接におけるワンショット視覚鑑別診断(OSVDE)と多段階対話型非劣性(MSCNE)の評価。 (OSVDE-MSCNE)
AI医療面接・診断システムの性能評価:ワンショット視覚的鑑別診断(OSVDE)と多段階対話的非劣性(MSCNE)評価。
本研究では、非識別化医療画像と半合成患者シミュレーションを用いたマルチモーダル人工知能(AI)システム(AIMD.1)の診断性能を評価します。 本研究は、既存の公開画像データセットの遡及的分析と、診断評価タスクを完了する認定臨床医からの前向きデータ収集を組み合わせています。
ワンショット視覚鑑別評価(OSVDE)段階では、臨床医が個々の非識別化医療画像を検討し、視覚的特徴のみに基づいて潜在的な診断のランク付けリストを生成します。 マルチステップ対話型非劣性評価(MSCNE)段階では、臨床医が非識別化医療画像から派生した半合成患者シミュレーションを使用して診断評価を完了します。 臨床医のパフォーマンスは、同じ診断タスクにおいてAIシステムと比較されます。
人間の参加者は、診断回答を提供する認定臨床医のみで構成されています。 医療画像とシミュレーション症例は研究材料であり、研究参加者とは見なされません。 識別可能な患者データは使用されておらず、AIシステムはオフライン研究環境で評価され、臨床意思決定や患者ケアには使用されません。
調査の概要
詳細な説明
人工知能(AI)システムは医療診断において有望な能力を示しているが、臨床導入前には厳密なベンチマーク評価が必要である。 AIMD.1は、医療画像と会話型診断インタラクションの分析を通じて臨床推論を支援するように設計されたマルチモーダルAI診断システムである。
本研究は、回顧的画像データセットと前向き臨床医評価タスクを組み合わせてAIMD.1の診断性能を評価する。 目的は、制御されたベンチマーク条件下でAIシステムが専門医認定を受けた臨床医と同等の診断精度を達成するかどうかを判断することである。
評価は二つの補完的段階を含む。
ワンショット視覚鑑別評価(OSVDE):
この段階では、AIシステムと臨床医参加者が個別の匿名化医療画像を独立してレビューし、視覚的特徴のみに基づいて潜在的な診断のランク付けリストを生成する。 評価では、検証済み参照診断を持つ複数の医療専門分野と疾患カテゴリーにわたる約11,500〜15,000枚の匿名化医療画像を使用する。
マルチステップ会話型非劣性評価(MSCNE):
この段階では、AIシステムと臨床医が匿名化医療画像から派生した半合成患者シミュレーションを使用して診断タスクを完了する。 これらのシミュレーションは会話型インタラクションを通じて構造化された臨床情報を提供し、複数のステップにわたる診断推論の評価を可能にする。 約380〜500のシミュレーション症例が評価される。
約10〜30人の専門医認定を受けた臨床医が研究に参加する。 臨床医は遠隔で診断評価セッションを完了し、画像およびシミュレーション症例のサブセットに対して鑑別診断を提供する。 人間参加者は診断回答を提供する臨床医のみで構成される。 画像データセットと合成症例は研究材料として機能し、参加者とはみなされない。
研究で使用されるすべての画像は匿名化されており、公開されているソースまたは匿名化基準を満たすデータセットに由来する。 追加の前処理ステップにより、研究データセットに含める前に潜在的に識別可能な情報が除去される。
AIシステムはオフライン研究環境で評価され、実際の臨床ケアや患者管理を指導するために使用されない。 本研究は、実際の患者を含む前向き検証の前に行われるベンチマーク性能評価として設計されている。
主要アウトカム指標には、トップ1診断精度(AIシステムの主要診断が参照診断と一致する症例の割合として定義される)などの診断精度指標が含まれる。 副次アウトカムには、トップ5診断精度、キャリブレーション指標、疾患カテゴリー全体の感度と特異度、および会話型診断シナリオにおける診断時間測定が含まれる。
データ分析では、診断精度を信頼区間で推定し、AIシステムの性能を臨床医の性能と比較するために、対応のある統計検定および非劣性分析を使用する。
臨床医の回答は匿名の研究識別子を使用して記録され、集計された性能結果のみが報告される。 臨床医または患者に関する識別可能な情報は収集または公開されない。
研究期間は約6か月と予想され、データセット準備、臨床医評価セッション、および統計分析を含む。
プロトコルID 1026は、2026年3月10日にSolutions IRB(855)226-4472(www.solutionsirb.com)により、45CFR46.104(d)に基づく免除として確認された。
研究の種類
入学 (推定)
連絡先と場所
研究連絡先
- 名前:Luis R Soenksen, MSE, PhD
- 電話番号:(617) 936-9293
- メール:soenksen@nollahealth.com
研究連絡先のバックアップ
- 名前:Sean Geiger, B.S.
- 電話番号:(412) 412-8786
- メール:sean@nollahealth.com
研究場所
-
-
New York
-
New York、New York、アメリカ、10003
- 募集
- Nolla Health (Magic Health Inc.)
-
コンタクト:
- Sean Geiger, B.S.
- 電話番号:(412) 412-8786
- メール:sean@nollahealth.com
-
コンタクト:
- Luis R Soenksen, MSE, PhD
- 電話番号:(617)936-9293
- メール:soenksen@nollahealth.com
-
主任研究者:
- Luis R Soenksen, MSE, PhD
-
副調査官:
- Sean Geiger, B.S.
-
副調査官:
- Luis Wenus
-
-
参加基準
適格基準
就学可能な年齢
- 大人
- 高齢者
健康ボランティアの受け入れ
サンプリング方法
調査対象母集団
説明
対象基準:
- 皮膚科、内科、耳鼻咽喉科、婦人科、整形外科、小児科、老年科、救急医学、眼科、精神科、内分泌科、家庭医療、または密接に関連する専門分野における有効な専門医認定
- 18歳以上
- 信頼性のあるインターネット接続が可能なコンピュータまたはタブレットを使用して、遠隔で診断評価セッションを完了できる能力
除外基準:
- 対象となる専門分野での有効な専門医認定の喪失
- 遠隔で評価セッションを完了できない場合
研究計画
研究はどのように設計されていますか?
デザインの詳細
コホートと介入
グループ/コホート |
介入・治療 |
|---|---|
|
臨床医参加者
匿名化された医療画像と半合成患者シミュレーションを用いて診断評価タスクに参加し、診断精度を評価する資格を持つ臨床医。
臨床医は、AI診断システムとのベンチマーク比較のために鑑別診断を提供します。
|
AIMD.1(別名:NollaMDエージェント)は、医療画像と構造化された臨床情報の分析に基づいて鑑別診断を生成するために設計されたマルチモーダル人工知能(AI)診断システムです。
この研究では、システムは、管理された研究条件下で、匿名化された医療画像と半合成患者シミュレーションを使用して評価されます。
AIシステムは、順位付けされた診断出力と関連する信頼度スコアを生成し、それらは参照診断および臨床医のパフォーマンス指標と比較されます。
システムは、オフライン研究環境で評価されます。
AI出力は、臨床的意思決定、患者管理、または実世界の医療には使用されません。
他の名前:
|
この研究は何を測定していますか?
主要な結果の測定
結果測定 |
メジャーの説明 |
時間枠 |
|---|---|---|
|
トップ1診断精度
時間枠:診断評価完了時(最大6か月)
|
AI診断システムによって生成された一次診断が参照(グランドトゥルース)診断と一致した評価症例の割合。
正確度は、匿名化された医療画像症例と半合成患者シミュレーション症例にわたって計算され、臨床医のパフォーマンスと比較されます。
|
診断評価完了時(最大6か月)
|
二次結果の測定
結果測定 |
メジャーの説明 |
時間枠 |
|---|---|---|
|
トップ5の診断精度
時間枠:診断評価完了時(最大6か月)
|
AI診断システムによって生成された上位5位までの診断ランキング内に、正しい参照診断が含まれている評価ケースの割合。
|
診断評価完了時(最大6か月)
|
|
臨床医参加者の診断精度
時間枠:診断評価完了時(最大6か月)
|
割り当てられた画像およびシミュレーション症例全体で計算された、臨床医参加者の一次診断が参照診断と一致する評価症例の割合。
|
診断評価完了時(最大6か月)
|
|
AI診断精度の臨床医との非劣性
時間枠:診断評価完了時(最大6ヶ月)
|
AI診断システムと臨床医参加者との間のTop-1診断精度の差。
非劣性は、事前に定義された5%のマージンを使用して評価されます。
|
診断評価完了時(最大6ヶ月)
|
|
AI診断信頼度のキャリブレーション
時間枠:診断評価完了時(最大6ヶ月間)
|
AI生成診断信頼度スコアのキャリブレーション性能は、期待キャリブレーション誤差(ECE)を用いて評価されました。
|
診断評価完了時(最大6ヶ月間)
|
|
受信者動作特性曲線下面積(AUC)と適合率-再現率曲線(PRC)
時間枠:診断評価完了時(最長6か月)
|
AI診断分類における疾患カテゴリー全体の受信者動作特性曲線下面積および適合率-再現率曲線
|
診断評価完了時(最長6か月)
|
|
会話シミュレーションにおける診断までの時間
時間枠:シミュレーション評価完了時(最長6か月)
|
半合成患者シミュレーションケースにおいて、最終診断に到達するために必要なAIシステムと臨床医参加者との対話ターン数。
|
シミュレーション評価完了時(最長6か月)
|
協力者と研究者
捜査官
- 主任研究者:Luis R Soenksen, MSE, PhD、Nolla Health
研究記録日
主要日程の研究
研究開始 (実際)
一次修了 (推定)
研究の完了 (推定)
試験登録日
最初に提出
QC基準を満たした最初の提出物
最初の投稿 (実際)
学習記録の更新
投稿された最後の更新 (実際)
QC基準を満たした最後の更新が送信されました
最終確認日
詳しくは
本研究に関する用語
その他の研究ID番号
- NH-OSVDE-MSCNE-1026
個々の参加者データ (IPD) の計画
個々の参加者データ (IPD) を共有する予定はありますか?
IPD プランの説明
医薬品およびデバイス情報、研究文書
米国FDA規制医薬品の研究
米国FDA規制機器製品の研究
この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。