急性呼吸衰竭诊断的人类算法交互
衡量人工智能对住院患者诊断的影响:一项随机调查 Vignette 多中心研究
人工智能 (AI) 在识别临床图像异常方面显示出良好的前景。 然而,存在系统偏差的人工智能模型(模型对整个亚群做出不准确的预测)可能会导致错误和潜在危害。 当人工智能模型显示出错误的预测时,临床医生的诊断准确性可能会受到损害。 本研究旨在研究在提供 AI 模型预测时为临床医生提供基于图像的 AI 模型解释的有效性,以帮助临床医生更好地理解 AI 模型预测的逻辑。 它将评估为临床医生提供人工智能模型解释是否可以提高诊断准确性并帮助临床医生发现模型何时做出错误决策。 作为一个测试案例,该研究将重点关注急性呼吸衰竭的诊断,因为确定急性呼吸衰竭的根本原因对于指导治疗决策至关重要,但在临床上可能具有挑战性。
为了确定提供人工智能解释是否可以提高临床医生的诊断准确性并减轻向临床医生展示系统性偏见人工智能模型的潜在影响,将进行一项随机临床小插曲调查研究。 在调查期间,研究参与者将看到因急性呼吸衰竭住院的患者的临床情况,包括患者出现的症状、体检、实验室结果和胸部 X 光检查。 然后,研究参与者将被要求评估心力衰竭、肺炎和/或慢性阻塞性肺疾病(COPD)是潜在诊断的可能性。 在调查的特定片段中,参与者还将看到标准或有系统偏差的人工智能模型,这些模型可以估计心力衰竭、肺炎和/或慢性阻塞性肺病是潜在诊断的可能性。 当显示人工智能模型时,临床医生将被随机查看单独的人工智能预测或带有解释的人工智能预测。 该调查设计将允许检验系统偏差模型会损害临床医生诊断准确性的假设,但常用的基于图像的解释将帮助临床医生部分恢复其表现。
研究概览
地位
条件
研究类型
注册 (实际的)
阶段
- 不适用
联系人和位置
学习地点
-
-
Michigan
-
Ann Arbor、Michigan、美国、48103
- University of Michigan
-
-
参与标准
资格标准
适合学习的年龄
- 成人
- 年长者
接受健康志愿者
描述
纳入标准:
- 作为临床实践的一部分,护理急性呼吸衰竭患者的医生、执业护士和医生助理
排除标准:
- 仅在门诊环境中提供患者护理的医生、执业护士和医师助理
学习计划
研究是如何设计的?
设计细节
- 主要用途:其他
- 分配:随机化
- 介入模型:并行分配
- 屏蔽:单身的
武器和干预
参与者组/臂 |
干预/治疗 |
|---|---|
|
实验性的:AI模型偏向于心力衰竭,没有AI解释
该组的参与者将在调查中的 3 个患者临床片段中看到标准 AI 模型预测,并在 3 个临床片段中看到系统性偏差的 AI 模型预测。
当显示系统性有偏差的 AI 模型预测时,该模型将对心力衰竭产生偏见,始终预测体重指数 (BMI) 等于或高于 30 的患者很可能出现心力衰竭。
将显示其他 2 种诊断的标准预测。
当显示人工智能模型预测时,该组的参与者不会看到人工智能解释。
|
在 6 个临床片段中,参与者将看到 AI 模型预测,但没有相应的 AI 解释。
AI 模型将为每种诊断(心力衰竭、肺炎、慢性阻塞性肺病)提供 0-100 分的评分,估计患者出现上述每种诊断的可能性有多大。
在 3 个临床小插图中,参与者将看到标准的 AI 模型预测,而 3 个小插图中,他们将看到系统性有偏见的 AI 模型预测,其中该模型特别针对三种诊断之一产生偏见。
在 3 个临床小插曲中,参与者将看到系统性偏向的 AI 模型预测,该模型特别针对心力衰竭产生偏向,始终预测体重指数 (BMI) 等于或高于 30 的调查小插曲患者很可能出现心力衰竭。
将显示其他 2 种诊断(肺炎、慢性阻塞性肺病)的标准预测。
|
|
实验性的:AI模型对肺炎存在偏见,没有AI解释
该组的参与者将在调查中的 3 个患者临床片段中看到标准 AI 模型预测,并在 3 个临床片段中看到系统性偏差的 AI 模型预测。
当显示系统性有偏差的 AI 模型预测时,该模型将对肺炎产生偏见,始终预测 80 岁或以上患者极有可能出现肺炎。
将显示其他 2 种诊断的标准预测。
当显示人工智能模型预测时,该组的参与者不会看到人工智能解释。
|
在 6 个临床片段中,参与者将看到 AI 模型预测,但没有相应的 AI 解释。
AI 模型将为每种诊断(心力衰竭、肺炎、慢性阻塞性肺病)提供 0-100 分的评分,估计患者出现上述每种诊断的可能性有多大。
在 3 个临床小插图中,参与者将看到标准的 AI 模型预测,而 3 个小插图中,他们将看到系统性有偏见的 AI 模型预测,其中该模型特别针对三种诊断之一产生偏见。
在 3 个临床小插曲中,参与者将看到系统性有偏见的 AI 模型预测,该模型特别针对肺炎产生偏见,始终预测调查小插曲中 80 岁或以上患者极有可能出现肺炎。
将显示其他 2 种诊断(心力衰竭、慢性阻塞性肺病)的标准预测。
|
|
实验性的:AI 模型偏向 COPD,没有 AI 解释
该组的参与者将在调查中的 3 个患者临床片段中看到标准 AI 模型预测,并在 3 个临床片段中看到系统性偏差的 AI 模型预测。
当显示系统性有偏差的 AI 模型预测时,该模型将对 COPD 产生偏差,当对患者的 X 射线应用预处理滤波器时,始终预测 COPD 存在的可能性很高。
将显示其他 2 种诊断的标准预测。
当显示人工智能模型预测时,该组的参与者不会看到人工智能解释。
|
在 6 个临床片段中,参与者将看到 AI 模型预测,但没有相应的 AI 解释。
AI 模型将为每种诊断(心力衰竭、肺炎、慢性阻塞性肺病)提供 0-100 分的评分,估计患者出现上述每种诊断的可能性有多大。
在 3 个临床小插图中,参与者将看到标准的 AI 模型预测,而 3 个小插图中,他们将看到系统性有偏见的 AI 模型预测,其中该模型特别针对三种诊断之一产生偏见。
在 3 个临床小插图中,将向参与者展示系统性有偏见的 AI 模型预测,该模型专门针对 COPD 存在偏见,始终预测调查小插图患者中很可能存在 COPD,其中对患者的 X 射线应用了预处理过滤器。
将显示其他 2 种诊断(心力衰竭、肺炎)的标准预测。
|
|
实验性的:AI 模型偏向心力衰竭,提出基于图像的 AI 解释
该组的参与者将在调查中的 3 个患者临床片段中看到标准 AI 模型预测,并在 3 个临床片段中看到系统性偏差的 AI 模型预测。
当显示系统性有偏差的 AI 模型预测时,该模型将对心力衰竭产生偏见,始终预测体重指数 (BMI) 等于或高于 30 的患者很可能出现心力衰竭。
将显示其他 2 种诊断的标准预测。
当显示人工智能模型预测时,该组的参与者还将看到人工智能解释。
|
在 3 个临床小插曲中,参与者将看到系统性偏向的 AI 模型预测,该模型特别针对心力衰竭产生偏向,始终预测体重指数 (BMI) 等于或高于 30 的调查小插曲患者很可能出现心力衰竭。
将显示其他 2 种诊断(肺炎、慢性阻塞性肺病)的标准预测。
在 6 个临床片段中,参与者将看到人工智能模型的预测和解释。
AI 模型将为每个诊断提供 0-100 分的评分。
在 3 个临床小插图中,参与者将看到标准的 AI 模型预测,而在 3 个小插图中,他们将看到系统性有偏见的 AI 模型预测,其中该模型特别针对三种诊断之一产生偏见。
如果 AI 模型提供的分数高于 50,则 AI 模型解释将显示为叠加在胸部 X 光片上的梯度加权类激活映射 (Grad-CAM) 热图,突出显示图像中哪些区域对 AI 模型的预测影响最大。
|
|
实验性的:AI模型偏向肺炎,提出基于图像的AI解释
该组的参与者将在调查中的 3 个患者临床片段中看到标准 AI 模型预测,并在 3 个临床片段中看到系统性偏差的 AI 模型预测。
当显示系统性有偏差的 AI 模型预测时,该模型将对肺炎产生偏见,始终预测 80 岁或以上患者极有可能出现肺炎。
将显示其他 2 种诊断的标准预测。
当显示人工智能模型预测时,该组的参与者还将看到人工智能解释。
|
在 3 个临床小插曲中,参与者将看到系统性有偏见的 AI 模型预测,该模型特别针对肺炎产生偏见,始终预测调查小插曲中 80 岁或以上患者极有可能出现肺炎。
将显示其他 2 种诊断(心力衰竭、慢性阻塞性肺病)的标准预测。
在 6 个临床片段中,参与者将看到人工智能模型的预测和解释。
AI 模型将为每个诊断提供 0-100 分的评分。
在 3 个临床小插图中,参与者将看到标准的 AI 模型预测,而在 3 个小插图中,他们将看到系统性有偏见的 AI 模型预测,其中该模型特别针对三种诊断之一产生偏见。
如果 AI 模型提供的分数高于 50,则 AI 模型解释将显示为叠加在胸部 X 光片上的梯度加权类激活映射 (Grad-CAM) 热图,突出显示图像中哪些区域对 AI 模型的预测影响最大。
|
|
实验性的:AI 模型偏向 COPD,提出基于图像的 AI 解释
该组的参与者将在调查中的 3 个患者临床片段中看到标准 AI 模型预测,并在 3 个临床片段中看到系统性偏差的 AI 模型预测。
当显示系统性有偏差的 AI 模型预测时,该模型将对 COPD 产生偏差,当对患者的 X 射线应用预处理滤波器时,始终预测 COPD 存在的可能性很高。
将显示其他 2 种诊断的标准预测。
当显示人工智能模型预测时,该组的参与者还将看到人工智能解释。
|
在 3 个临床小插图中,将向参与者展示系统性有偏见的 AI 模型预测,该模型专门针对 COPD 存在偏见,始终预测调查小插图患者中很可能存在 COPD,其中对患者的 X 射线应用了预处理过滤器。
将显示其他 2 种诊断(心力衰竭、肺炎)的标准预测。
在 6 个临床片段中,参与者将看到人工智能模型的预测和解释。
AI 模型将为每个诊断提供 0-100 分的评分。
在 3 个临床小插图中,参与者将看到标准的 AI 模型预测,而在 3 个小插图中,他们将看到系统性有偏见的 AI 模型预测,其中该模型特别针对三种诊断之一产生偏见。
如果 AI 模型提供的分数高于 50,则 AI 模型解释将显示为叠加在胸部 X 光片上的梯度加权类激活映射 (Grad-CAM) 热图,突出显示图像中哪些区域对 AI 模型的预测影响最大。
|
研究衡量的是什么?
主要结果指标
结果测量 |
措施说明 |
大体时间 |
|---|---|---|
|
跨临床场景设置的参与者诊断准确性
大体时间:第 0 天
|
诊断准确性定义为正确诊断评估的数量除以诊断评估总数。
在审查了调查中每位患者的临床情况后,参与者将被要求对每个临床情况进行三项单独的诊断评估,一项针对心力衰竭、肺炎和慢性阻塞性肺病。
如果参与者的评估与每个插图的参考标签一致,则诊断评估被认为是正确的。
诊断评估将在参与者完成调查(第 0 天)时、在参与者查看临床小插图后立即进行。
将在不同的小插图设置(无 AI 模型、标准 AI 模型、带解释的标准 AI 模型、有偏见的 AI 模型、带解释的有偏见的 AI 模型)之间比较参与者的诊断准确性。
|
第 0 天
|
次要结果测量
结果测量 |
措施说明 |
大体时间 |
|---|---|---|
|
跨临床场景设置的治疗选择准确性
大体时间:第 0 天
|
治疗选择准确性被定义为参与者是否在临床小插图中为患者选择正确的治疗,并且可以为患者选择类固醇、抗生素、静脉(IV)利尿剂的任意组合,或者不选择这些治疗。
治疗选择评估将在参与者完成调查(第 0 天)时、在参与者查看临床情况后立即进行。
将在不同的小插图设置中比较参与者治疗选择的准确性(无 AI 模型、标准 AI 模型、带解释的标准 AI 模型、有偏见的 AI 模型、带解释的有偏见的 AI 模型)。
|
第 0 天
|
|
跨临床小插图设置的诊断特定诊断准确性
大体时间:第 0 天
|
在小插图设置中针对心力衰竭、肺炎和慢性阻塞性肺病的诊断准确性
|
第 0 天
|
合作者和调查者
调查人员
- 首席研究员:Michael Sjoding, MD、University of Michigan
研究记录日期
研究主要日期
学习开始 (实际的)
初级完成 (实际的)
研究完成 (实际的)
研究注册日期
首次提交
首先提交符合 QC 标准的
首次发布 (实际的)
研究记录更新
最后更新发布 (实际的)
上次提交的符合 QC 标准的更新
最后验证
更多信息
与本研究相关的术语
其他研究编号
- HUM00180745
- R01HL158626 (美国 NIH 拨款/合同)
计划个人参与者数据 (IPD)
计划共享个人参与者数据 (IPD)?
IPD 计划说明
IPD 共享时间框架
IPD 共享访问标准
IPD 共享支持信息类型
- 研究方案
- 树液
药物和器械信息、研究文件
研究美国 FDA 监管的药品
研究美国 FDA 监管的设备产品
此信息直接从 clinicaltrials.gov 网站检索,没有任何更改。如果您有任何更改、删除或更新研究详细信息的请求,请联系 register@clinicaltrials.gov. clinicaltrials.gov 上实施更改,我们的网站上也会自动更新.