此页面是自动翻译的,不保证翻译的准确性。请参阅 英文版 对于源文本。

项目 3 示例:人机协作测试仪 (HAICT) Exp. 7

2025年12月29日 更新者:Jeremy M Wolfe, PhD、Brigham and Women's Hospital
这项研究是构成国家眼科研究所资助项目三的一系列实验的一部分。 项目三包括一系列实验,研究改变模拟人工智能的输入如何影响人类观察者在两种选择的强制选择任务中做出的决定(例如召回一名女性进行乳房X光检查的决定)。 这里描述的实验 HAICT 7 研究了当人工智能用作第二读者时,变化的流行率如何影响人类的表现。

研究概览

详细说明

本文是开放科学框架中描述的 HAICT 7 实验预注册的文本。 https://osf.io/hngu4/

注:这项研究代表了本次资助的项目 3 中进行的研究。 项目 3 代表的实验包中有多个实验,但无法在 CT.gov 上注册研究包。

注意:由于代词注释是建议性的,我们暂时保留它。

人机协作测试仪 (HAICT) Exp. 7(由 OSF 轻微编辑)

  1. 数据采集​​。 是否已经为这项研究收集了任何数据? (是/否)

    是的

  2. 假设。 这项研究提出的主要问题或检验的假设是什么?

背景:在各种基础和临床搜索实验中,数据与信号(或目标)的变异性大于噪声(干扰因素)的变异性的情况一致。 其典型标志是 zROC 函数,其斜率 < 1 - 通常约为 0.6。 斜率 1.0 表示等方差 2AFC 任务。 对于我们一直在测试的 HAICT 任务,我们期望方差相等,但我们认为值得检查,因此我们将系统地改变患病率,这将改变标准。 这将扫出我们可以检查的 ROC 曲线。

我们还将测试第二个读者的人造人工智能,以确定低流行率是否会使第二个读者变得更糟。

  • (H1):我们期望重复这一发现,即随着患病率下降,人类标准变得更加保守。
  • (H2):我们预测所得 zROC 的斜率为 1.0。
  • (H3):我们假设低流行率会降低 Second Reader AI 的有效性,因为其评论的阳性预测值会很低。

    1. 因变量。 描述关键因变量,指定如何测量它们。

      感兴趣的主要因变量是准确性(以及准确性的信号检测导数 d' 和 c)、反应时间以及每个块之后的调查的主观评分。

    2. 状况。 参与者将被分配到多少个以及哪些条件?

这一系列实验研究了改变模拟人工智能的输入如何影响人类观察者在两种选择的强制选择任务中做出的决定(例如召回一名女性进行乳房X光检查的决定)。 我们开发了一种名为“人类与人工智能协作测试器”(HAICT) 的范例,可以有效测试人类与模拟人工智能之间的交互。

在任何情况下,观察员的任务都是就刺激措施是“坏”还是“不错”做出 2AFC 决定。 为了使用大致模仿医学诊断的语言,每个刺激都被称为“案例”。 观察员被要求对彩色形状数组做出 2AFC 决策。 该决定是根据案件的主要颜色做出的。 每种颜色的元素数量取自两个正态分布之一,一个用于正(坏)刺激,另一个用于负(不错)刺激。

之前的 HAICT 实验(3 和 4)的结果表明,在第二读者条件下,人类的表现在低流行率下显着下降。 当不良案例的发生率为 50% 时,第二读者条件下的表现优于基线,但当不良案例的发生率仅为 10% 时,第二读者条件下的表现明显低于基线。 在这个实验中,我们操纵了第二读者和基线条件下“坏”案例的发生率。 将测试四种不同的患病率:10%、33%、67% 和 90%。 观察者将完成 8 个区块(2 个 AI 规则 x 4 个流行率),区块顺序是随机的。

待测试的AI规则:

  1. 基线 - 无 AI 输入。 观察者将每个案例单独分类为“坏”或“不”坏。
  2. 第二位读者——观察者对每个案例做出初步决定。 AI 使用保守标准(c = 0.5)默默地对刺激进行分类。 保守标准的逻辑是,第二个阅读器被用来减少误报,因此它的目的是质疑可能微不足道的人类积极反应。 如果观察者和人工智能意见不一致,人工智能就会通知人类观察者。 然后观察者有机会改变他们的反应或遵循他们的第一意见。

    与实验 1-5 一样,AI d-prime 固定为 2.2。 众所周知,反馈会增加流行效应,因此在实践和测试中都会给出反馈。 观察员将在每个区块中完成 20 次练习试验和 200 次测试试验。 每个区块完成后,观察者将立即看到其表现的摘要。 在第二个读者区块之后,他们还将被要求回答三个有关人工智能有用性的主观问题(有关更多详细信息,请参阅“文件”)。

  3. 分析。 准确指定您将进行哪些分析来检验主要问题/假设。

    首先,我们总结每个块中的命中数、真负数、未命中数和误报数。 由此,我们可以计算每个观察者在每种不同条件下的准确性、阳性​​预测值、敏感性(d-prime)和标准。 给定 4 个患病率水平的表现测量值,我们可以估计 ROC 曲线 (pHit x pFA) 和 zROC 函数 (zHit x zFA)。 我们将测试 zROC 的斜率等于 1 的假设(等方差 2AFC 任务的结果)。

  4. 更多分析。 有二次分析吗?

    我们将研究观察者对人工智能的主观看法是否与经验 d 素数或阳性预测值等变量相关。

  5. 样本大小。 将收集多少观察结果或什么决定样本大小? 无需证明决定的合理性,但要准确说明如何确定该数字。

    我们将测试 12 名观察员。 这与之前实验的样本量是一致的。

  6. 其他。 您还有什么需要预先登记的吗? (例如,数据排除、出于探索性目的收集的变量、计划的异常分析?)

不适用

研究类型

介入性

注册 (实际的)

12

阶段

  • 不适用

联系人和位置

本节提供了进行研究的人员的详细联系信息,以及有关进行该研究的地点的信息。

学习地点

    • Massachusetts
      • Boston、Massachusetts、美国、02215
        • Visual Attention Lab / Brigham and Women's Hospital

参与标准

研究人员寻找符合特定描述的人,称为资格标准。这些标准的一些例子是一个人的一般健康状况或先前的治疗。

资格标准

适合学习的年龄

18年 及以上 (成人、年长者)

接受健康志愿者

是的

描述

纳入标准:

  • - 欢迎大家网上报名

排除标准:

  • 必须通过石原色觉筛查测试
  • 20/25 视力(带矫正)

学习计划

本节提供研究计划的详细信息,包括研究的设计方式和研究的衡量标准。

研究是如何设计的?

设计细节

  • 主要用途:基础科学
  • 分配:不适用
  • 介入模型:单组作业
  • 屏蔽:无(打开标签)

武器和干预

参与者组/臂
干预/治疗
实验性的:实验
所有参与者都在本实验的所有条件下进行测试。
在此实验中,在某些情况下,参与者在存在有关模拟人工智能决策的信息的情况下做出决定。
提出目标的频率从 10% 到 90% 不等
其他名称:
  • 基本利率

研究衡量的是什么?

主要结果指标

结果测量
措施说明
大体时间
D'
大体时间:数据在一个约一小时的会话内收集。
D'(d-prime)是信号检测理论中衡量任务表现水平的指标。 它通过计算真阳性反应比例 =(真阳性试验) /(真阳性 + 假阴性试验)= p(TP),以及计算假阳性反应比例 =(假阳性试验) /(假阳性 + 真阴性试验)= p(FP) 来得出。 这些值会被转换为“z分数”(例如,在Excel中使用NORMSINV函数计算标准正态分布的反函数)。 D'的定义为Z(TP) - Z(FP)。 其范围从0(表示无法从噪声中区分出信号的情况)到约4.0。 上限未明确定义,但4表示观察者在区分信号与噪声方面近乎完美。
数据在一个约一小时的会话内收集。
标准
大体时间:数据在一个大约一小时的会话内收集。
标准,如D'(见上文)是根据z(TP)和z(FP)计算得出的。 标准(c)= (z(TP)+z(FP))/-2。 值为零表示观察者做出阳性(如“目标存在”)反应与阴性(不存在)反应的可能性相等。 正值表示观察者更可能说“不存在”(“保守”标准)。 负值表示观察者更可能说“存在”(“自由”标准)。 在此情况下,自由和保守没有政治含义。 标准值几乎总是在-2到2之间。
数据在一个大约一小时的会话内收集。

次要结果测量

结果测量
措施说明
大体时间
反应时间
大体时间:数据在一个约一小时的会话内收集。
这是衡量响应所需时间的指标。
数据在一个约一小时的会话内收集。

合作者和调查者

在这里您可以找到参与这项研究的人员和组织。

调查人员

  • 首席研究员:Jeremy M Wolfe, PhD、Brigham and Women's Hospital

研究记录日期

这些日期跟踪向 ClinicalTrials.gov 提交研究记录和摘要结果的进度。研究记录和报告的结果由国家医学图书馆 (NLM) 审查,以确保它们在发布到公共网站之前符合特定的质量控制标准。

研究主要日期

学习开始 (实际的)

2020年1月1日

初级完成 (实际的)

2024年8月1日

研究完成 (实际的)

2025年11月4日

研究注册日期

首次提交

2022年2月18日

首先提交符合 QC 标准的

2022年2月28日

首次发布 (实际的)

2022年3月9日

研究记录更新

最后更新发布 (实际的)

2026年1月20日

上次提交的符合 QC 标准的更新

2025年12月29日

最后验证

2025年12月1日

更多信息

与本研究相关的术语

其他相关的 MeSH 术语

其他研究编号

  • 2007P000646-B
  • R01CA207490 (美国 NIH 拨款/合同)

计划个人参与者数据 (IPD)

计划共享个人参与者数据 (IPD)?

是的

IPD 计划说明

去识别化的原始数据将发布在实验的 OSF 页面上,也可根据 PI 的要求提供。

IPD 共享时间框架

将根据要求提供材料

IPD 共享访问标准

基本上不受限制

IPD 共享支持信息类型

  • 研究方案
  • 树液
  • 国际碳纤维联合会

药物和器械信息、研究文件

研究美国 FDA 监管的药品

不

研究美国 FDA 监管的设备产品

不

此信息直接从 clinicaltrials.gov 网站检索,没有任何更改。如果您有任何更改、删除或更新研究详细信息的请求,请联系 register@clinicaltrials.gov. clinicaltrials.gov 上实施更改,我们的网站上也会自动更新.

订阅