此页面是自动翻译的,不保证翻译的准确性。请参阅 英文版 对于源文本。

使用机器学习识别因 COPD 恶化入院的患者并预测再入院风险

2025年1月22日 更新者:Robert Wu、University Health Network, Toronto

使用自然语言处理和机器学习识别因 COPD 恶化而入院的患者以及对再入院高风险患者进行分层

入院的慢性阻塞性肺疾病 (COPD) 患者再入院的风险很高。 虽然治疗有所改进,并且有基于证据的指南来减少再入院率,但实施仍面临重大挑战,包括 1) 在入院早期识别所有 COPD 患者,以确保提供基于证据的高价值护理,以及 2) 识别那些重新入院的高风险,以便有效地瞄准资源。

使用机器学习和自然语言处理,我们希望开发模型以 1) 识别所有入院的 COPD 恶化患者,以及 2) 对他们进行分层以区分再次入院的高风险患者 b) 您将如何开展工作? 我们将从多伦多医院开发一个非常大的患者入院数据集,包括来自电子健康记录的 COPD 恶化的所有医疗条件。 这些数据将包括结构化数据,如年龄、性别、药物、实验室值、合并症,以及非结构化数据,如出院摘要和医生记录。

使用该数据集,我们将通过自然语言处理和机器学习训练一个模型,以便能够识别因 COPD 恶化而入院的人,并识别那些将在 30 天内再次入院的高风险患者。 我们将测试这些模型的能力以确定我们的预测准确性。 然后我们将在其他机构测试这些模型。

研究概览

详细说明

五分之一因 COPD 加重而出院的患者在 30 天内再次入院。(1, 3, 4) 虽然治疗和护理指南有所改进,但指南的执行情况仍然很差。(5) 通过通常的医院工作流程实施适当的标准提出了重大挑战。 最大的挑战之一是确保及时发现所有符合条件的 COPD 恶化患者。 (6) 另一个最大的挑战是工作人员通常太忙,没有时间执行减少再入院率的循证实践。 (6) 此外,由于资源有限,无法向所有人提供密集的个案管理。 因此,重要的是我们能够识别早期因 COPD 入院的人以及再入院风险高的人。

COPD 恶化有时可能一开始不容易识别,需要几天时间才会变得明显。 呼吸急促等加重症状并不特异,胸片浸润等体征可能由一种或多种诊断引起。 此外,COPD 恶化可触发或由其他疾病触发。 因此,入院医生收治多项临时诊断为心力衰竭、肺炎、COPD 恶化等的患者并不少见。 没有将诊断列为编码元素的电子健康记录 (EHR) 进一步混淆了 COPD 恶化患者的区分。 最终结果是跨专业团队的其他成员很难在入院早期发现 COPD 患者。 一些美国医院通过让非医疗保健提供者审查图表来识别因慢性阻塞性肺病入院的患者来解决这个问题。 (7) 另一种方法是机器学习和自然语言处理。 这已经在心力衰竭患者身上取得了一些成功,但在慢性阻塞性肺病患者身上却鲜有成效。 (13) 在一个试点项目中,自然语言处理有助于识别 COPD 患者。 (7)

为最需要的人提供稀缺资源,有助于进一步确定再入院风险高的患者。 这将是确定如何实施有效策略以降低再入院率的第一步。 有为内科和外科患者开发的再入院预测模型,包括 LACE 评分和 HOSPITAL 评分。 (8, 9) 不幸的是,那些经过研究的人似乎在 COPD 人群中表现不佳。 (10) 虽然已经确定了有助于预测 COPD 再入院的因素,但这些模型尚未得到充分验证。 (11, 12)可以通过使用非结构化数据(例如临床医生进度记录和出院摘要)来提高性能。

及早识别患有 COPD 的人并了解那些有再入院风险的人可以改善健康结果。 扎法尔等人。表明,包括 1. 吸入器评估、2. 适当的吸入器方案、3. 早期出院随访和 4. 以患者为中心的出院指导在内的综合性 COPD 护理包减少了再入院率。 (14) 识别那些有再入院高风险的人可以促进进入强化病例管理。 因此,我们将进行当前的研究,以确定因 COPD 急性加重入院的患者,并根据再入院的风险对患者进行分层

方法:

使用来自大学健康网络 (UHN) 的回顾性数据,我们将创建过去 5 年普通内科的录取数据集。 我们估计这将包括大约 40,000 人入院,其中 2,000 人将被诊断为 COPD 恶化。 数据集将包含结构化编码数据和非结构化文本数据。 编码数据将包括年龄、性别、订购的药物、合并症、实验室值和肺功能测试。 非结构化文本数据将包括 EHR 中的注释:医生诊所注释、出院摘要、入院诊断、进度注释以及来自我们的签收系统的注释。

分析:我们将使用几种不同的方法来开发模型,包括逻辑回归、深度神经网络和卷积神经网络。 具体来说,我们还将使用统计机器学习算法进行事件检测,使用跨各种输入类型(例如,傅立叶滤波器组、梅尔频率倒谱系数、小波和原始音频)的双向长短期记忆神经网络。 我们还将使用传统方法,例如动态贝叶斯网络和条件随机场。 在文本分析方面,我们将确定预测重新接纳的关键短语。 一种方法是使用语篇分析从背景文本中挑出“核心”短语。 我们还将构建“联合”预测模型,将非结构化文本的特征与结构化编码数据的特征结合起来。 我们将使用 ROC 曲线下的标准面积来评估模型性能,并使用交叉验证来最小化过度拟合的影响。 最后,我们将使用来自不同中心的数据集验证我们的模型,以确定这些结果是否有效和可推广。

预期结果:基于 EHR 数据开发两种经过验证的模型:一种用于准确识别 AECOPD 患者,另一种用于准确识别 30 天内再入院高风险患者。

研究类型

观察性的

注册 (实际的)

65000

联系人和位置

本节提供了进行研究的人员的详细联系信息,以及有关进行该研究的地点的信息。

学习地点

    • Ontario
      • Toronto、Ontario、加拿大、M5G 2C4
        • University Health Network

参与标准

研究人员寻找符合特定描述的人,称为资格标准。这些标准的一些例子是一个人的一般健康状况或先前的治疗。

资格标准

适合学习的年龄

18年 及以上 (成人、年长者)

接受健康志愿者

不

取样方法

非概率样本

研究人群

使用来自大学健康网络 (UHN) 的回顾性数据,我们将创建一个过去 7 年普通内科录取的数据集。

描述

纳入标准:

  • 2012-2018 年间普通内科的所有入院人数

排除标准:

-

学习计划

本节提供研究计划的详细信息,包括研究的设计方式和研究的衡量标准。

研究是如何设计的?

设计细节

研究衡量的是什么?

主要结果指标

结果测量
措施说明
大体时间
识别 COPD 恶化
大体时间:入场内
为了识别 COPD 恶化,我们将使用该次就诊的最负责任的诊断代码。
入场内
再入院风险
大体时间:30天
为确定再入院,我们将在 COPD 恶化指数入院后 30 天内包括所有原因再入院,这与之前的研究类似。 (3)
30天

合作者和调查者

在这里您可以找到参与这项研究的人员和组织。

研究记录日期

这些日期跟踪向 ClinicalTrials.gov 提交研究记录和摘要结果的进度。研究记录和报告的结果由国家医学图书馆 (NLM) 审查,以确保它们在发布到公共网站之前符合特定的质量控制标准。

研究主要日期

学习开始 (实际的)

2019年6月1日

初级完成 (实际的)

2021年8月31日

研究完成 (实际的)

2023年12月31日

研究注册日期

首次提交

2019年12月6日

首先提交符合 QC 标准的

2019年12月6日

首次发布 (实际的)

2019年12月10日

研究记录更新

最后更新发布 (实际的)

2025年3月25日

上次提交的符合 QC 标准的更新

2025年1月22日

最后验证

2025年1月1日

更多信息

与本研究相关的术语

药物和器械信息、研究文件

研究美国 FDA 监管的药品

不

研究美国 FDA 监管的设备产品

不

此信息直接从 clinicaltrials.gov 网站检索,没有任何更改。如果您有任何更改、删除或更新研究详细信息的请求,请联系 register@clinicaltrials.gov. clinicaltrials.gov 上实施更改,我们的网站上也会自动更新.

订阅