评估AI医学问诊中单次视觉差异诊断(OSVDE)与多步骤对话非劣效性(MSCNE) (OSVDE-MSCNE)
AI医学访谈与诊断系统性能评估:单次视觉鉴别诊断(OSVDE)与多步骤对话非劣效性(MSCNE)评估。
本研究评估多模态人工智能(AI)系统(AIMD.1)的诊断性能,使用去标识化医学图像和半合成患者模拟。该研究结合对现有公开图像数据集的回顾性分析,以及从完成诊断评估任务的委员会认证临床医生处收集的前瞻性数据。
在单次视觉鉴别评估(OSVDE)阶段,临床医生审查单个去标识化医学图像,并仅基于视觉特征生成潜在诊断的排名列表。在多步骤对话非劣效性评估(MSCNE)阶段,临床医生使用源自去标识化医学图像的半合成患者模拟完成诊断评估。临床医生的表现将在相同诊断任务上与AI系统进行比较。
人类参与者仅包括提供诊断响应的委员会认证临床医生。医学图像和模拟病例是研究材料,不被视为研究参与者。未使用可识别患者数据,且AI系统在离线研究环境中进行评估,不用于临床决策或患者护理。
研究概览
详细说明
人工智能(AI)系统在医学诊断方面展现出有前景的能力;然而,在临床部署之前需要进行严格的基准评估。
AIMD.1是一种多模态AI诊断系统,旨在通过分析医学图像和对话式诊断交互来辅助临床推理。
本研究通过结合回顾性图像数据集和前瞻性临床医生评估任务来评估AIMD.1的诊断性能。
目标是在受控基准条件下确定AI系统是否达到与获得委员会认证的临床医生相当的诊断准确性。
评估包括两个互补阶段。
一次性视觉鉴别评估(OSVDE):
在此阶段,AI系统和临床医生参与者独立审查单个去标识化的医学图像,并仅根据视觉特征生成潜在诊断的排名列表。
评估将使用约11,500-15,000张涵盖多个医学专业和疾病类别的去标识化医学图像,这些图像均具有已验证的参考诊断。
多步骤对话非劣效性评估(MSCNE):
在此阶段,AI系统和临床医生使用源自去标识化医学图像的半合成患者模拟来完成诊断任务。
这些模拟通过对话式交互提供结构化的临床信息,从而允许评估跨多个步骤的诊断推理。
将评估约380-500个模拟病例。
约10-30名获得委员会认证的临床医生将参与本研究。
临床医生将远程完成诊断评估会话,并为图像和模拟病例的子集提供鉴别诊断。
人类参与者仅包括提供诊断响应的临床医生。
图像数据集和合成病例作为研究材料,不被视为参与者。
研究中使用的所有图像均已去标识化,并源自公开可用的来源或符合去标识化标准的数据集。
在纳入研究数据集之前,额外的预处理步骤确保移除任何潜在的可识别信息。
AI系统在离线研究环境中进行评估,不用于指导真实世界的临床护理或患者管理。
本研究设计为在涉及真实患者的前瞻性验证之前进行的基准性能评估。
主要结局指标包括诊断准确性指标,如Top-1诊断准确性,定义为AI系统的主要诊断与参考诊断匹配的病例比例。
次要结局包括Top-5诊断准确性、校准指标、跨疾病类别的敏感性和特异性,以及对话式诊断场景中的诊断时间测量。
数据分析将使用置信区间估计诊断准确性,并通过配对统计检验和非劣效性分析比较AI系统与临床医生的性能。
临床医生的响应使用匿名研究标识符记录,仅报告汇总性能结果。
不会收集或发布有关临床医生或患者的任何可识别信息。
研究持续时间预计约为六个月,包括数据集准备、临床医生评估会话和统计分析。
方案ID 1026已于2026年3月10日由Solutions IRB (855) 226-4472 (www.solutionsirb.com)根据45CFR46.104(d)豁免条款验证为豁免。
研究类型
注册 (估计的)
联系人和位置
学习联系方式
- 姓名:Luis R Soenksen, MSE, PhD
- 电话号码:(617) 936-9293
- 邮箱:soenksen@nollahealth.com
研究联系人备份
- 姓名:Sean Geiger, B.S.
- 电话号码:(412) 412-8786
- 邮箱:sean@nollahealth.com
学习地点
-
-
New York
-
New York、New York、美国、10003
- 招聘中
- Nolla Health (Magic Health Inc.)
-
接触:
- Sean Geiger, B.S.
- 电话号码:(412) 412-8786
- 邮箱:sean@nollahealth.com
-
接触:
- Luis R Soenksen, MSE, PhD
- 电话号码:(617)936-9293
- 邮箱:soenksen@nollahealth.com
-
首席研究员:
- Luis R Soenksen, MSE, PhD
-
副研究员:
- Sean Geiger, B.S.
-
副研究员:
- Luis Wenus
-
-
参与标准
资格标准
适合学习的年龄
- 成人
- 年长者
接受健康志愿者
取样方法
研究人群
描述
纳入标准:
- 皮肤科、内科、耳鼻喉科、妇科、骨科、儿科、老年科、急诊科、眼科、精神科、内分泌科、家庭医学或密切相关专科的现行执业认证
- 年龄18岁或以上
- 能够使用具有可靠网络连接的电脑或平板电脑远程完成诊断评估会话
排除标准:
- 失去符合条件的专科的现行执业认证
- 无法远程完成评估会话
学习计划
研究是如何设计的?
设计细节
队列和干预
团体/队列 |
干预/治疗 |
|---|---|
|
临床医生参与者
参与使用去标识化医学影像和半合成患者模拟进行诊断评估任务的持照临床医生,以评估诊断准确性。
临床医生提供鉴别诊断,用于与AI诊断系统进行基准比较。
|
AIMD.1(又称NollaMD代理)是一种多模态人工智能(AI)诊断系统,旨在通过分析医学影像和结构化临床信息生成鉴别诊断。
在本研究中,系统在受控研究条件下使用去标识化医学影像和半合成患者模拟进行评估。
该AI系统生成分级诊断输出及相关置信度评分,并与参考诊断及临床医生表现指标进行比较。
系统在离线研究环境中进行评估。
AI输出不用于临床决策、患者管理或真实世界医疗服务。
其他名称:
|
研究衡量的是什么?
主要结果指标
结果测量 |
措施说明 |
大体时间 |
|---|---|---|
|
Top-1 诊断准确性
大体时间:诊断评估完成时(最长6个月)
|
AI诊断系统生成的主要诊断与参考(真实)诊断相匹配的评估病例比例。
准确性将通过去标识化的医学影像病例和半合成患者模拟病例进行计算,并与临床医生的表现进行比较。
|
诊断评估完成时(最长6个月)
|
次要结果测量
结果测量 |
措施说明 |
大体时间 |
|---|---|---|
|
前五大诊断准确性
大体时间:诊断评估完成后(最长6个月)
|
在AI诊断系统生成的前五名诊断排名中,正确参考诊断出现的评估病例比例。
|
诊断评估完成后(最长6个月)
|
|
临床医生参与者的诊断准确性
大体时间:在完成诊断评估时(最多6个月)
|
临床医生参与者的初步诊断与参考诊断相匹配的评估病例比例,根据分配的图像和模拟病例计算得出。
|
在完成诊断评估时(最多6个月)
|
|
AI诊断准确率与临床医生相比的非劣效性
大体时间:诊断评估完成后(最长6个月)
|
AI诊断系统与临床医生参与者在Top-1诊断准确性方面的差异。
非劣效性将使用预设的5%界值进行评估。
|
诊断评估完成后(最长6个月)
|
|
AI诊断置信度校准
大体时间:诊断评估完成后(最长6个月)
|
使用预期校准误差(ECE)评估AI生成诊断置信度得分的校准性能。
|
诊断评估完成后(最长6个月)
|
|
受试者工作特征曲线下面积(AUC)与精确率-召回率曲线(PRC)
大体时间:诊断评估完成时(最长6个月)
|
人工智能诊断分类在不同疾病类别中的受试者工作特征曲线下面积与精确率-召回率曲线。
|
诊断评估完成时(最长6个月)
|
|
对话模拟中的诊断时间
大体时间:模拟评估完成后(最长6个月)
|
在半合成患者模拟案例中,AI系统与临床医生参与者达成最终诊断所需的对话轮次。
|
模拟评估完成后(最长6个月)
|
合作者和调查者
调查人员
- 首席研究员:Luis R Soenksen, MSE, PhD、Nolla Health
研究记录日期
研究主要日期
学习开始 (实际的)
初级完成 (估计的)
研究完成 (估计的)
研究注册日期
首次提交
首先提交符合 QC 标准的
首次发布 (实际的)
研究记录更新
最后更新发布 (实际的)
上次提交的符合 QC 标准的更新
最后验证
更多信息
此信息直接从 clinicaltrials.gov 网站检索,没有任何更改。如果您有任何更改、删除或更新研究详细信息的请求,请联系 register@clinicaltrials.gov. clinicaltrials.gov 上实施更改,我们的网站上也会自动更新.