此页面是自动翻译的,不保证翻译的准确性。请参阅 英文版 对于源文本。

利用行为助推减轻医师-大语言模型诊断推理中的自动化偏见

2026年6月24日 更新者:Ihsan Ayyub Qazi, PhD、Lahore University of Management Sciences

通过行为助推减轻医生-LLM诊断推理中的自动化偏见

这项随机对照试验的目的是评估行为助推是否能减少医生在使用大型语言模型(如ChatGPT-5.1)进行临床决策时的自动化偏见,即对自动化输出的不加批判接受。

它旨在回答的主要问题是:双重机制行为助推干预(基线准确性锚定加案例特定颜色编码置信信号)是否能减少医生对不正确大型语言模型建议的不加批判接受?

研究人员将比较接收大型语言模型建议并伴有行为助推的医生与接收大型语言模型建议但无助推的医生,以评估助推是否能减少自动化偏见。

参与者将:

  • 评估六个伴随大型语言模型生成建议的临床案例(其中一半包含故意、临床显著的错误)。
  • 对照组:能够以标准格式查看大型语言模型建议,无助推。
  • 治疗组:能够查看ChatGPT在标准医学数据集上的诊断准确性作为初始锚点,然后接收每个建议旁的颜色编码置信信号(例如,红色表示低置信度)。
  • 由盲审评审员使用专家开发的评估标准评估其反应,以检测对错误信息的不加批判接受。

研究概览

地位

完全的

条件

详细说明

自动化偏见是现代临床实践中的一个关键挑战,特别是随着人工智能工具日益融入医疗工作流程。这种认知现象描述了临床医生倾向于接受自动化决策系统建议的倾向,即使这些建议是错误的。随着ChatGPT-5.1等大型语言模型在医疗环境中获得广泛应用,它们在减少错误和提高效率方面的潜力必须与一个重大问题进行权衡:这些模型缺乏严格的医学验证,可能通过不正确或误导性的建议放大现有的认知偏见。

医疗环境中自动化偏见的出现反映了环境和心理因素的复杂相互作用。高负荷临床环境中的时间限制产生了压力,使人们在未经充分审查的情况下接受人工智能生成的建议。将效率置于彻底性之上的财务激励可能进一步阻碍健全临床判断所必需的批判性评估。长时间轮班导致的认知疲劳降低了医生持续分析思考的能力。这些压力与心理机制相互作用,包括责任分散、对技术解决方案的过度自信和认知卸载,共同创造了条件,使得不加批判地接受人工智能生成的建议变得更加可能。

这项随机对照试验评估了一种行为助推干预措施的有效性,该干预旨在减轻使用大型语言模型生成诊断建议的医生中的自动化偏见。主要目标是确定这种干预措施在评估包含故意有缺陷的大型语言模型建议的临床案例时,是否能提高诊断推理表现分数。次要目标包括评估医生经验水平、性别和先前的大型语言模型经验是否会调节干预措施的有效性,确定不同置信度信号下案例干预效果是否存在差异。

本研究采用单盲、随机对照试验设计,包含两个平行组。参与者将被随机1:1分配到干预组或对照组。为了消除提示技能差异带来的变异性,参与者将不直接与实时大型语言模型界面交互。相反,所有参与者将使用一个定制构建的网络平台,该平台显示带有预生成大型语言模型建议的临床案例,确保每个案例的大型语言模型生成内容完全相同。

所有参与者将在一次约75分钟的监考会议中评估六个临床案例。其中三个案例将在大型语言模型建议中故意引入临床推理缺陷,而三个案例将包含正确的建议。案例将以随机顺序呈现,以防止模式检测。

对照组参与者将评估带有ChatGPT生成的大型语言模型诊断建议的临床案例,这些建议以标准、中性的文本格式呈现,没有额外的背景信息。干预组参与者将评估相同的案例,同时接受行为助推干预。该干预包括两个同步的认知提示:(1) 锚定提示在界面面板顶部显示ChatGPT在标准医学数据集上的基线诊断准确性,明确将期望锚定在模型的可错性上;(2) 选择性注意提示将大型语言模型建议与通过集成评估生成的颜色编码置信度信号一起显示:三个独立的最先进大型语言模型各自为建议提供置信度评级,平均置信度决定信号颜色,以减轻单一模型校准错误。

颜色编码的置信度信号根据集成平均置信度相对于基线诊断准确性分为三个不同级别。当平均置信度低于ChatGPT的既定基线准确性时触发红色信号,明确标记需要高度批判性审查的高不确定性案例。橙色信号表示虽然平均置信度超过基线平均值,但仍低于100%,表明需要持续的临床警惕并避免自满。最后,绿色信号保留给集成共识达到100%的情况;然而,即使在这个置信度水平,标准的人工智能安全警告仍然存在,以防止过度依赖系统的输出。

参与者将看到六个专门设计用于测量自动化偏见的临床案例,这些案例源自真实病例并经过修改,代表了一系列诊断难度和常见医学专科。每个案例遵循标准化格式,包括主诉、现病史、相关既往病史/社会史/家族史、体格检查结果和初始实验室结果。

主要结果是诊断推理表现分数,这是一个基于结构化评分标准的复合百分比分数,评估:鉴别诊断质量、支持性发现、反对性发现、最终诊断准确性以及下一步措施的适当性。次要结果包括首选诊断准确性(不正确、部分正确或正确)。所有回答将由盲审员使用评估标准进行评估。

研究类型

介入性

注册 (实际的)

72

阶段

  • 不适用

联系人和位置

本节提供了进行研究的人员的详细联系信息,以及有关进行该研究的地点的信息。

学习地点

    • Punjab Province
      • Lahore、Punjab Province、巴基斯坦、54792
        • Lahore University of Management Sciences

参与标准

研究人员寻找符合特定描述的人,称为资格标准。这些标准的一些例子是一个人的一般健康状况或先前的治疗。

资格标准

适合学习的年龄

  • 孩子
  • 成人
  • 年长者

接受健康志愿者

是的

描述

纳入标准:

  • 在巴基斯坦医学与牙科理事会(PMDC)注册(完全注册或临时注册)的执业医师。
  • 已完成内外全科医学学士(MBBS)考试。在美国和加拿大,与MBBS等同的学位是医学博士(MD)。
  • 参与者必须完成关于使用ChatGPT(或类似大型语言模型)的结构化培训项目,总教学时长至少为10小时。该项目必须包含与大型语言模型关键方面相关的实践操作,特别是提示工程和内容评估。

排除标准:

  • 在PMDC注册(完全注册或临时注册)的任何其他执业医师(例如,拥有牙科外科学士或BDS学位的专业人士)。

学习计划

本节提供研究计划的详细信息,包括研究的设计方式和研究的衡量标准。

研究是如何设计的?

设计细节

  • 主要用途:诊断
  • 分配:随机化
  • 介入模型:并行分配
  • 屏蔽:单身的

武器和干预

参与者组/臂
干预/治疗
有源比较器:ChatGPT 推荐配合行为助推
参与者将评估六个临床案例。 在试验期间,除了传统的诊断资源外,他们还将获得来自特定商业化LLM(ChatGPT)的临床建议。 对于三个案例,LLM建议将包含故意错误的诊断信息;对于另外三个案例,则包含准确的建议。 案例将以随机顺序呈现。 此组参与者将在LLM建议界面中接收一个行为助推,当展开LLM面板时,会显示两个同步的认知提示:(1) 在面板顶部显示锚定提示,展示ChatGPT在标准医学数据集上的基线诊断准确性,以设定现实的期望;紧接着下方是提示干预,显示LLM建议以及案例特定的颜色编码置信度信号。
治疗组的参与者将在LLM推荐界面中接受行为干预,该界面在LLM面板展开时呈现两个同步的认知提示:(1)在面板顶部显示锚定提示,展示ChatGPT在标准医学数据集上的基线诊断准确性,以便在查看具体推荐前设定合理期望;(2)位于正下方的选择性注意提示,该提示在展示LLM推荐的同时,提供一个针对具体案例且颜色编码的信度信号。 当平均集成信度低于既定基线准确性时,该信号被标记为红色,表示需要严格评估的高不确定性案例;当信度达到或超过基线但低于100%时,信号标记为橙色,旨在防止自满并保持积极的临床审查;当集成共识为100%时,信号标记为绿色,但标准警告提示仍然适用,以防疏漏。
无干预:ChatGPT建议(无行为助推)
参与者将评估六个临床案例。 在试验期间,除了传统的诊断资源外,他们还将获得特定商业可用大语言模型(ChatGPT)的临床建议。 其中三个案例的大语言模型建议将包含故意有缺陷的诊断信息。 案例将以随机顺序呈现。 该组的参与者不会收到任何行为提示。

研究衡量的是什么?

主要结果指标

结果测量
措施说明
大体时间
诊断推理准确性评分
大体时间:在每个病例的预定诊断推理评估期间进行单次评估,该评估在参与者入组后0-5天内进行。
主要结局指标为每个病例的正确答案百分比,范围为0%至100%,分数越高表示诊断性能越好。 对于每个病例,参与者需提供其三个主要诊断、支持每个诊断的发现以及反对每个诊断的发现。 对于每个合理的诊断,参与者将获得1分。 支持诊断的发现和反对诊断的发现也将根据正确性进行评分,每个正确答案得1分。 随后,参与者需指出其认为最有可能的首要诊断,合理回答得9分,最准确回答得18分。 最后,参与者需提出最多3个后续步骤以进一步评估患者,部分正确回答得0.5分,完全正确回答得1分。 主要结局指标将在随机分组间进行病例层面的比较。
在每个病例的预定诊断推理评估期间进行单次评估,该评估在参与者入组后0-5天内进行。

次要结果测量

结果测量
措施说明
大体时间
首选诊断准确度评分
大体时间:在每个病例的预定诊断推理评估会议期间,于单一时间点进行评估,该会议在参与者入组后的0-5天内进行。
次要结局指标将衡量参与者在识别每个临床案例最可能诊断方面的表现。 评估每个病例后,参与者将选择其认为最可能的单一诊断,该选择将按照预设的三级诊断准确性量表进行评分:最准确诊断得18分,临床合理替代诊断得9分,错误诊断得0分。 针对每位参与者,将计算首选诊断准确性得分:(获得总分 ÷ 可能最高分)× 100,得出0-100%的范围,其中较高分数表示更高的诊断准确性。 该百分比得分将在随机分组间进行病例级别的比较,以量化自动化偏见对诊断决策的影响。
在每个病例的预定诊断推理评估会议期间,于单一时间点进行评估,该会议在参与者入组后的0-5天内进行。

合作者和调查者

在这里您可以找到参与这项研究的人员和组织。

调查人员

  • 首席研究员:Muhammad Asadullah Khawaja, MBBS、King Edward Medical University
  • 首席研究员:Ihsan Ayyub Qazi, PhD、Lahore University of Management Sciences (LUMS)
  • 首席研究员:Ali Zafar Sheikh, MBBS、Lahore General Hospital
  • 首席研究员:Muhammad Junaid Akhtar, MBBS、Children's Hospital, Lahore
  • 首席研究员:Muhammad Hamad Alizai, PhD、Lahore University of Management Sciences (LUMS)

研究记录日期

这些日期跟踪向 ClinicalTrials.gov 提交研究记录和摘要结果的进度。研究记录和报告的结果由国家医学图书馆 (NLM) 审查,以确保它们在发布到公共网站之前符合特定的质量控制标准。

研究主要日期

学习开始 (实际的)

2026年1月17日

初级完成 (实际的)

2026年5月25日

研究完成 (实际的)

2026年5月26日

研究注册日期

首次提交

2025年12月26日

首先提交符合 QC 标准的

2025年12月26日

首次发布 (实际的)

2026年1月9日

研究记录更新

最后更新发布 (实际的)

2026年6月25日

上次提交的符合 QC 标准的更新

2026年6月24日

最后验证

2026年6月1日

更多信息

与本研究相关的术语

其他相关的 MeSH 术语

其他研究编号

  • LUMS-IRB-0412/12192025/IAQ-FWA

计划个人参与者数据 (IPD)

计划共享个人参与者数据 (IPD)?

不

药物和器械信息、研究文件

研究美国 FDA 监管的药品

不

研究美国 FDA 监管的设备产品

不

此信息直接从 clinicaltrials.gov 网站检索,没有任何更改。如果您有任何更改、删除或更新研究详细信息的请求,请联系 register@clinicaltrials.gov. clinicaltrials.gov 上实施更改,我们的网站上也会自动更新.

订阅