此页面是自动翻译的,不保证翻译的准确性。请参阅 英文版 对于源文本。

大型语言模型的反馈可以提高医疗保健质量吗?

2026年1月30日 更新者:Jason Abaluck、Yale University

LLM工具的飞行员Ptudy,以支持低资源环境中的前线卫生工作者

这项研究的目的是了解计算机辅助的建议是否可以帮助改善尼日利亚卫生诊所的患者护理。 它旨在回答的主要问题是:为医疗保健工人提供即时计算机反馈是否可以帮助他们做出更好的患者护理决定?

研究人员将在收到计算机反馈之前和之后由医疗保健工人撰写的患者护理笔记进行比较,以查看反馈是否提高了护理质量。 一位不知道是否给予反馈的医生会审查这些笔记。

参与者将:

  • 由使用计算机反馈系统的社区医疗保健工作者看到
  • 受到全面训练的医生治疗
  • 如果患有某些症状,接受疟疾,贫血或尿路感染的测试

研究概览

详细说明

该项目测试大型语言模型(LLMS)是否可以通过自然语言向提供商进行自定义和即时反馈来改善尼日利亚初级保健诊所的患者护理。 集成到电子患者记录管理系统中的基于LLM的工具为尼日利亚两个诊所的社区健康扩展工人(CHEWS)提供了“第二意见”。 这些第二意见旨在反映审查医师在看到或听到有关患者的初步报告后可能会建议咀嚼的建议。

对于主要分析,本研究对咀嚼产生的两个患者笔记进行了治疗比较。在最初的患者咨询期间,一个在收到LLM反馈后的一个。 一位负责患者护理的全面训练的医疗官也可以看到该患者。 MO对Chew的患者注意事项进行了盲目的评论,以衡量法学学士的反馈导致Chew护理的变化。 数据来自患者电子病历(EMR)中捕获的信息,以及从咀嚼物收集的调查数据,审查MOS和审查医生的小组。

研究类型

介入性

注册 (实际的)

491

阶段

  • 不适用

联系人和位置

本节提供了进行研究的人员的详细联系信息,以及有关进行该研究的地点的信息。

学习地点

    • Kano State
      • Kano、Kano State、尼日利亚
        • EHA Clinics REACH Community Clinic, Gyadi Gyadi
      • Kano、Kano State、尼日利亚
        • EHA Clinics, 33 Lamido Crescent

参与标准

研究人员寻找符合特定描述的人,称为资格标准。这些标准的一些例子是一个人的一般健康状况或先前的治疗。

资格标准

适合学习的年龄

  • 孩子
  • 成人
  • 年长者

接受健康志愿者

不

描述

纳入标准:

  • 患者正在诊所进行门诊咨询
  • 18岁以下个人需要父母/监护人同意

排除标准:

  • 患者不需要紧急护理
  • 患者没有在诊所进行检查(例如 体重,血压,恢复后跟进)
  • 患者不是创伤患者(请参观不是出于事故,伤口或伤害)
  • 患者不在诊所内进行计划或出生

学习计划

本节提供研究计划的详细信息,包括研究的设计方式和研究的衡量标准。

研究是如何设计的?

设计细节

  • 主要用途:卫生服务研究
  • 分配:不适用
  • 介入模型:单组作业
  • 屏蔽:无(打开标签)

武器和干预

参与者组/臂
干预/治疗
实验性的:有或没有LLM的临床评估
调查人员采用了门内设计。 患者从社区卫生扩展工作者那里获得两次顺序评估:首先没有大量的语言模型援助。
集成到诊所的电子病历系统中的大型语言模型(LLM)提供了有关患者评估的实时反馈。 社区卫生扩展工人首先创建标准肥皂说明,将其提交给LLM,并收到详细的反馈和关键建议。 然后,他们可以根据此反馈更新评估。 所有最终治疗决定均由独立评估患者的医务人员做出。

研究衡量的是什么?

主要结果指标

结果测量
措施说明
大体时间
治疗计划中错误的指标(有可能造成伤害)
大体时间:通过学习完成,平均六个月

在肥皂说明评估期间,要求MO指示患者的治疗计划是否包含任何错误,以MO自身的诊断为条件。 如果MO表示有错误,则该编码为1,否则为0。

介绍性文本(此处用于肥皂说明A)是:请评估肥皂中的治疗是否适合此患者的病情。 请根据您自己的诊断为基础,而不是肥皂笔记中的咀嚼诊断。

接下来是一个问题:肥皂中患者的治疗计划是否鉴于您自己的诊断(根据医学测试来考虑有条件治疗)? 如果您的诊断,请回答“否”,如果患者应获得不同的医疗服务。 这可能包括较小的差异(例如,应该建议患者休息)和重大错误(例如,患者应接受完全不同的药物组合)。 (答案选项:是/否/不确定)

通过学习完成,平均六个月
指标在治疗计划中导致至少X质量调整的终生损失的指标
大体时间:通过学习完成,平均六个月
如果MO表示存在此类错误,则该变量为1,否则为0。 X被定义为适当的Daly量表上最高的基准,因此在无助的肥皂说明中,至少有5%的患者的误差很大。 换句话说,严重的错误是在无助的量表(合并儿童和成人量表)上产生或高于第95个百分位数的损害评级的任何错误。
通过学习完成,平均六个月
更好的治疗计划的指标(由MOS确定)
大体时间:通过学习完成,平均六个月
基于肥皂注释A与B的DALY评级(未误差为0 daly损失的计数实例),如果肥皂笔记具有更好的治疗计划(较低的daly损失),则指标将编码为1关于以下问题的回答相同的注意事项:肥皂注释A和B的治疗计划是否有任何有意义的差异?
通过学习完成,平均六个月
治疗是否与预定的“护理标准”一致的指标
大体时间:通过学习完成,平均六个月

高危患者根据某些人口标准接受疟疾,贫血和UTI筛查。 然后对每个患者进行一个观察结果(患者,筛查测试,注意),每位患者最多六个。

治疗分配的指标记录了患者是否根据测试结果或缺乏症状对病情进行了错误治疗。 如果患者测试阳性并且接受不合适或没有治疗,则将变量编码为1。 如果患者对症状筛查进行了阴性测试或未对其进行测试,但接受了该疾病的治疗方法,则也将其编码为1。 如果患者测试阴性且未针对相应的疾病进行正确处理,或者他们测试阳性并接受了正确的治疗方法,则该变量仅编码为0。

通过学习完成,平均六个月

次要结果测量

结果测量
措施说明
大体时间
表示咀嚼与MOS之间的诊断和治疗对准的指标
大体时间:通过学习完成,平均六个月

对于Chew治疗计划中的每种药物,都有一个“临床适应症”(与药物相关的诊断)以及指定给定处方是否有条件的医疗测试结果的指标。 研究团队将考虑一场比赛的三个指标:

  • 跨药物的“临床指示”领域内容的任何匹配;
  • 跨适应症的“药物”字段内容的任何匹配,包括药物是否在测试上是有条件的;
  • 药物和适应症(以及测试条件)的匹配。
通过学习完成,平均六个月
治疗分配不当的替代指标
大体时间:通过学习完成,平均六个月

研究小组将构建以下治疗分配的指标:

  • 由于定义过高而导致的分配:治疗患者已确认不具有的疾病
  • 由于处方不足而导致的分配:确认患者患有的病情未接受治疗
  • 由于不正确的给药或药物选择而导致的分配:患者患有患者的状况,但选择的剂量或药物是不合适的。
通过学习完成,平均六个月
QALY损失与患者状况严重程度的关系
大体时间:通过学习完成,平均六个月

在仅有轻度疾病的患者中,相对于患有更严重疾病的患者,QALY损失的范围可能受到限制。

考虑到这一点,QALY丢失在轻度,中度和严重疾病的指标上(由MO评估)都与辅助注释指标相互作用,从而控制了患者的固定效果。 结果将以图形方式显示。

通过学习完成,平均六个月
医学测试决策适当性的指标
大体时间:通过学习完成,平均六个月

医学测试的潜在分配通过两种方式进行操作:

  1. 对于每种测试类型,研究团队将构建一个指标,该指标被编码为1,如果Chew建议进行测试结果为负,则第二个指标是1积极。
  2. 其次,研究团队将在(患者,测试,注意)的级别上构建一个指标,该指标衡量咀嚼和MO要求相同或可比的医学测试(例如,咀嚼要求疟疾RDT )。

将这些指标结合起来,仅当且仅当两者:i)咀嚼要求未要求测试时发生不匹配,或者是正面的,或II)咀嚼要求测试,但结果为负,并且没有同等的测试。莫。

通过学习完成,平均六个月
Daly丢失的平均和分布
大体时间:通过学习完成,平均六个月
LLM辅助的影响Daly丢失是直接测量而不是间接测量的(如误差和严重误差的可能性,这是更好的说明)。 结果也将显示在辅助和未辅助说明的DALY评级的完整分布。
通过学习完成,平均六个月
MO评估肥皂注:与MO肥皂的偏差
大体时间:通过学习完成,平均六个月
要求MO评估每种肥皂的记录是否需要或在临床上有用,是否缺失或不正确/不必要的诊断,以及是否缺失或不正确/不必要的治疗计划元素。
通过学习完成,平均六个月
MO评估肥皂注:造成伤害的类型
大体时间:通过学习完成,平均六个月
要求MO评估任何短期危害(一定时期的其他症状或不适),以及肥皂说明中治疗计划中的任何长期严重伤害(损害,死亡等风险)。
通过学习完成,平均六个月
MO评估肥皂笔记:测量Daly损失的健康时间
大体时间:通过学习完成,平均六个月
MO还提供了一个总体评级,该评级旨在反映肥皂笔记中的任何治疗错误的“健康时间”。 对于由咀嚼(有或没有LLM建议)构建的每个评估和计划,MO将评估如果实施咀嚼计划而不是MO的计划,则会评估将会丢失的健康生活的预期幅度。
通过学习完成,平均六个月
MD评估咀嚼和MO注释:标记MO错误
大体时间:通过学习完成,平均六个月
第一步,他们将仅审查MO注释,并记录条件笔记中提出的诊断或治疗方法是否存在任何错误。 如果确定错误,MDS将通过严重程度对错误进行评分,以将医疗错误与不存在的患者的意见分歧区分。
通过学习完成,平均六个月
MD评估Chew和Mo Notes:肥皂笔记评级
大体时间:通过学习完成,平均六个月

要求医学博士评估任何短期危害(某个时期的其他症状或不适),以及肥皂说明中治疗计划中的任何长期严重伤害(有损伤,死亡的风险)。

MD还提供了一个总体评级,该评级旨在反映肥皂说明中任何治疗中的任何错误的“健康时间”。 对于由咀嚼(有或没有LLM建议)构建的每个评估和计划,MO将评估如果实施咀嚼计划而不是MO的计划,则会评估将会丢失的健康生活的预期幅度。 健康的时间以残疾调整的生活年份(Dalys)为单位,这反映了生活的长度和质量。

通过学习完成,平均六个月
MD评估Chew和Mo注释:LLM评论
大体时间:通过学习完成,平均六个月

MDS还将审查LLM反馈并回答以下问题:

“咀嚼是否遵循所有人,或者没有LLM建议?” 如果有些或没有:“想象一下咀嚼遵循LLM的所有建议。 由此产生的治疗计划会改善其辅助笔记吗?”(是/否)如果是:“请解释。”。 “ LLM有没有犯错误?” (是/否)如果是:“咀嚼辅助治疗计划的任何方面是否比无助计划更糟糕,因为咀嚼遵循了LLM的错误建议?” 如果是:“请解释。

通过学习完成,平均六个月
指标适当的分类决定
大体时间:通过学习完成,平均六个月
对于每个(患者,注意),一个指标记录了咀嚼分诊的决定(肥皂说明中指示的分类的意图)和MO建议的分类决策。
通过学习完成,平均六个月

合作者和调查者

在这里您可以找到参与这项研究的人员和组织。

调查人员

  • 首席研究员:Jason Abaluck、Yale University

研究记录日期

这些日期跟踪向 ClinicalTrials.gov 提交研究记录和摘要结果的进度。研究记录和报告的结果由国家医学图书馆 (NLM) 审查,以确保它们在发布到公共网站之前符合特定的质量控制标准。

研究主要日期

学习开始 (实际的)

2025年1月30日

初级完成 (实际的)

2025年10月17日

研究完成 (实际的)

2025年10月17日

研究注册日期

首次提交

2025年1月23日

首先提交符合 QC 标准的

2025年2月6日

首次发布 (实际的)

2025年2月12日

研究记录更新

最后更新发布 (实际的)

2026年2月3日

上次提交的符合 QC 标准的更新

2026年1月30日

最后验证

2025年4月1日

更多信息

与本研究相关的术语

其他研究编号

  • 2000035990

计划个人参与者数据 (IPD)

计划共享个人参与者数据 (IPD)?

是的

IPD 计划说明

将共享以下识别的个人参与者数据(IDP):

患者人口统计学和生命力症状和临床发现记录了咀嚼和MOS测试结果(疟疾,贫血,UTI)治疗计划和处方计划和处方肥皂笔记,并在咀嚼和MOS提供者评估和DALY评级的情况下有无LLM辅助,以及来自Chews和MD Panel的Daly评级响应评论

IPD 共享时间框架

从发布后3个月开始,将向其他研究人员提供数据,并且无结束日期可用。

IPD 共享访问标准

研究机构正式任命的学术研究人员必须提交一项研究建议,详细介绍预期的分析并签署数据使用协议。

IPD 共享支持信息类型

  • 研究方案
  • 树液
  • 国际碳纤维联合会
  • 分析代码
  • 企业社会责任

药物和器械信息、研究文件

研究美国 FDA 监管的药品

不

研究美国 FDA 监管的设备产品

不

此信息直接从 clinicaltrials.gov 网站检索,没有任何更改。如果您有任何更改、删除或更新研究详细信息的请求,请联系 register@clinicaltrials.gov. clinicaltrials.gov 上实施更改,我们的网站上也会自动更新.

订阅