此页面是自动翻译的,不保证翻译的准确性。请参阅 英文版 对于源文本。

AI辅助肝细胞癌分期与治疗决策制定

2026年4月13日 更新者:Jiahong Dong,MD、Beijing Tsinghua Chang Gung Hospital

一项前瞻性、随机、对照、交叉研究:人工智能辅助肝细胞癌多维分期与治疗决策

原发性肝细胞癌(HCC)的精准治疗高度依赖于准确的疾病分期(CNLC、TNM、BCLC)和科学的治疗决策,这需要整合影像学和临床基线数据。 本研究前瞻性招募不同医院层级的HCC患者和临床医师,以评估自主研发的人工智能(AI)模型在辅助多维综合评估和治疗决策中的临床价值。 采用多阅片者多病例(MRMC)交叉平衡设计,研究比较了医师在“无辅助(无AI)”与“AI辅助”条件下进行临床评估的准确性。 关键重点是探索AI是否能显著提升初级/二级医院医师的综合评估能力,从而前瞻性减少不同机构层级的诊疗异质性。

研究概览

详细说明

  1. 研究描述

    简要摘要:原发性肝细胞癌(HCC)的精准治疗高度依赖于准确的疾病分期(CNLC、TNM、BCLC)和科学的治疗决策,这需要影像学与临床基线数据的整合。 本研究前瞻性招募不同医院层级的HCC患者和临床医师,评估自主研发的人工智能(AI)模型在辅助多维综合评估和治疗决策中的临床价值。 采用多评估者多案例(MRMC)交叉平衡设计,比较医师在“无辅助(无AI)”与“AI辅助”条件下进行临床评估的准确性。 重点关注AI是否能显著提升初级/二级医疗医院医师的综合评估能力,从而前瞻性降低不同机构层级的诊断和治疗异质性。

    金标准(参考标准):所有前瞻性入组病例的参考标准(Ground Truth)由3名权威专家组成的独立专家组确定。 专家组通过盲法独立评估和联合讨论(投票制),结合完整的前瞻性影像数据、临床基线数据、多学科团队(MDT)共识以及最终病理或临床随访结果,确定四项分类任务的最终标准答案。

  2. 入选标准

2.1 评估者入选标准:

  1. 三级医院高级医师:受聘于三级甲等(三级)医院肝胆胰外科、肿瘤科或相关科室,职称为主治医师及以上。
  2. 三级医院初级医师:受聘于三级甲等(三级)医院相关科室,职称为住院医师。
  3. 初级/二级医疗医院医师:受聘于县级或二级综合医院的临床医师。
  4. 知情同意:必须自愿同意参与评估并签署知情同意书。

2.2 患者/病例入选标准:

纳入标准:

  1. 年龄 > 18岁。
  2. 前瞻性就诊疑似或新诊断的原发性肝细胞癌(HCC),后经病理证实或符合中国肝癌(CNLC)指南。
  3. 在前瞻性入组期间获取完整的基线临床数据,包括完整现病史/既往史、ECOG PS评分、全面实验室检查(肝功能、凝血功能、AFP等肿瘤标志物)以及基线腹部增强CT。
  4. 患者(或其法定代表)必须提供书面知情同意,允许其临床数据用于本试验。

排除标准:

  1. 患有继发性(转移性)肝癌或合并其他系统严重恶性肿瘤的患者。
  2. 未能完成所需基线影像或实验室检查,导致无法准确计算分期(例如缺失Child-Pugh评分数据)的患者。
  3. 入组前曾接受过肝癌抗肿瘤治疗的患者。

3. 研究设计

干预模型:交叉分配 盲法:单盲。 参与评估者对病例的金标准答案及其他参与医师的评估结果设盲。

分组与干预:

病例集划分:108例前瞻性连续入组的合格HCC病例分批并随机分为数据集A组(54例)和数据集B组(54例)。 确保两组在肿瘤负荷、肝功能分级和分期分布方面无统计学显著差异。

评估者分组:共纳入12名前瞻性招募的临床医师,包括4名三级医院高级组、4名三级医院初级组和4名初级/二级医院组。 根据分层随机化分为两个评估组:

A组(6名评估者):2名三级高级、2名三级初级、2名初级/二级医院。

B组(6名评估者):2名三级高级、2名三级初级、2名初级/二级医院。

组1 - A组评估者:

第1阶段干预(对照):独立评估A组(54例)结合临床文本和影像数据,记录4项分类结果,无AI辅助。

第2阶段干预(实验):评估B组(54例)。 系统展示AI模型的4项预测结果及相关证据;医师综合参考后给出最终判断。

组2 - B组评估者:

第1阶段干预(对照):独立评估B组(54例)结合临床文本和影像数据,记录4项分类结果,无AI辅助。

第2阶段干预(实验):评估A组(54例)。 医师参考AI模型结果后给出最终判断。

4. 结局指标

主要结局:

总体准确性提升:AI辅助评估(实验组)与独立评估(对照组)在4项分类任务中平均准确性的差异。

次要结局:

同质化效应:评估在AI辅助下,初级/二级医院组医师与三级医院组医师的临床评估准确性差异是否显著减小。

评估效率:比较医师在有AI辅助和无AI辅助下每例病例的平均评估时间。

评估者间一致性:比较医师评估结果的一致性(例如使用Kappa统计量),在有AI辅助和无AI辅助情况下。

5. 统计分析计划与样本量

样本量依据:

本研究样本量计算基于前瞻性招募的所有层级医师总体平均准确性的预期变化。 估计无AI辅助的总体平均准确性为0.60,有AI辅助为0.70。

设定双侧检验显著性水平为0.05(对应Z值约1.96),统计效能为0.80(对应Z值约0.84),采用比较两个独立比例的标准统计方法确定样本量。 假设同一医师评估多个病例无聚类效应,计算表明每个干预组至少需要353次独立评估。

效能验证:

在本研究实际配置中,共有12名医师。

对照组(无AI)总独立评估次数 = A组(6名评估者)× A组(54例)+ B组(6名评估者)× B组(54例)= 648次独立评估。

实验组(有AI)总独立评估次数同样 = 648次独立评估。

由于648次评估大于所需基准353次评估,当前病例和医师配置已具备足够统计效能。 此样本量提供了保守余量(约为基准要求的1.8倍),足以考虑本MRMC设计中同一医师评估多个病例可能产生的任何聚类效应(组内相关性)。

研究类型

观察性的

注册 (估计的)

108

联系人和位置

本节提供了进行研究的人员的详细联系信息,以及有关进行该研究的地点的信息。

学习联系方式

学习地点

    • Changping
      • Beijing、Changping、中国、102218
        • 招聘中
        • Beijing Tsinghua Changgung Hospital
        • 接触:

参与标准

研究人员寻找符合特定描述的人,称为资格标准。这些标准的一些例子是一个人的一般健康状况或先前的治疗。

资格标准

适合学习的年龄

  • 成人
  • 年长者

接受健康志愿者

不

取样方法

非概率样本

研究人群

本研究人群包括108名前瞻性连续入组的新诊断原发性肝细胞癌(HCC)成年患者。 完成入组并确认完整的基线临床和影像学数据后,这108例患者病例被随机分为两个相等的数据集:A组(54例)和B组(54例)。 随机化采用分层设计,以确保两组在肿瘤负荷、肝功能分级和分期分布等基线特征方面无统计学显著差异。

在此多阅片者多病例(MRMC)交叉设计的背景下,这些患者病例被分配到不同的评估条件。 A组病例由第一组审阅医师在没有AI辅助(对照组)和第二组医师在AI辅助(实验组)下进行评估。 反之,B组病例由第二组医师在没有AI辅助下进行评估。

描述

纳入标准:

  • 年龄≥18岁。
  • 前瞻性入组的疑似或新诊断原发性肝细胞癌(HCC)患者,后期经病理证实或符合中国肝癌(CNLC)指南。
  • 在前瞻性入组期间获取完整的基线临床数据,包括完整现病史/既往病史、ECOG PS评分、全面的实验室检查(肝功能、凝血功能、肿瘤标志物如AFP等)以及基线腹部增强CT。
  • 患者(或其法定代理人)必须提供书面知情同意,允许其临床数据用于本试验。

排除标准:

  • 患有继发性(转移性)肝癌或合并其他系统严重恶性肿瘤的患者。
  • 未能完成所需基线影像学或实验室检查,导致无法准确计算分期(例如,缺少Child-Pugh评分数据)的患者。
  • 入组前曾接受过肝癌抗肿瘤治疗的患者。

学习计划

本节提供研究计划的详细信息,包括研究的设计方式和研究的衡量标准。

研究是如何设计的?

设计细节

队列和干预

团体/队列
干预/治疗
A组评估员
前瞻性招募了6名医师(包括2名三级医院高级医师、2名三级医院初级医师及2名一/二级医院医师)。 在第一阶段(对照组),他们在无AI辅助的情况下独立评估肝癌病例集A。 在第二阶段(实验组),他们在AI模型辅助下评估病例集B。
医生独立评估HCC病例,仅依据完整的临床基线数据和影像学数据提供分期和治疗决策,无需AI模型辅助。
医生在审查自主研发的人工智能(AI)模型生成的初步预测及相关证据,结合临床基线和影像数据后,评估HCC病例并提供最终分期与治疗决策。
B组评估员
前瞻性招募了6名医生(2名三级医院高级医师、2名三级医院初级医师和2名一级/二级医院医生)。 在第一阶段(对照组),他们在没有AI辅助的情况下独立评估肝癌病例集B。 在第二阶段(实验组),他们在AI模型的辅助下评估病例集A。
医生独立评估HCC病例,仅依据完整的临床基线数据和影像学数据提供分期和治疗决策,无需AI模型辅助。
医生在审查自主研发的人工智能(AI)模型生成的初步预测及相关证据,结合临床基线和影像数据后,评估HCC病例并提供最终分期与治疗决策。

研究衡量的是什么?

主要结果指标

结果测量
措施说明
大体时间
整体准确性的改进
大体时间:最长1周(完成所有病例评估后评估)
AI辅助评估(实验组)与独立评估(对照组)在4项分类任务中平均准确率的差异。 准确率通过将医生的预测结果与独立专家小组建立的参考标准(Ground Truth)进行对比来确定
最长1周(完成所有病例评估后评估)

次要结果测量

结果测量
措施说明
大体时间
均质化效应对评估准确性的影响
大体时间:最长1周(完成所有病例评估后评估)
评估在人工智能辅助下,与无辅助独立评估相比,基层/二级医院组与三级医院组医师临床评估准确性差异是否显著缩小。
最长1周(完成所有病例评估后评估)
评估效率(每例平均耗时)
大体时间:最多1周(在所有病例评估完成后评估)
比较参与医生在利用人工智能辅助与进行无辅助独立评估时,每个病例所需的平均评估时间(例如,以分钟为单位)。
最多1周(在所有病例评估完成后评估)
评估者间一致性
大体时间:最多1周(在所有病例评估完成后评估)
在所有参与医师中,比较AI辅助与无辅助条件下评估结果(分期和治疗决策)的一致性,并使用适当的统计方法(例如Kappa统计量)进行评估。
最多1周(在所有病例评估完成后评估)

合作者和调查者

在这里您可以找到参与这项研究的人员和组织。

研究记录日期

这些日期跟踪向 ClinicalTrials.gov 提交研究记录和摘要结果的进度。研究记录和报告的结果由国家医学图书馆 (NLM) 审查,以确保它们在发布到公共网站之前符合特定的质量控制标准。

研究主要日期

学习开始 (估计的)

2026年4月13日

初级完成 (估计的)

2026年5月13日

研究完成 (估计的)

2026年5月20日

研究注册日期

首次提交

2026年4月13日

首先提交符合 QC 标准的

2026年4月13日

首次发布 (实际的)

2026年4月20日

研究记录更新

最后更新发布 (实际的)

2026年4月20日

上次提交的符合 QC 标准的更新

2026年4月13日

最后验证

2026年4月1日

更多信息

与本研究相关的术语

计划个人参与者数据 (IPD)

计划共享个人参与者数据 (IPD)?

未定

IPD 计划说明

个人参与者数据的共享,尤其是高分辨率医学影像(CT扫描)和临床基线数据,需遵循严格的机构数据安全政策及国家关于患者隐私的法规。 因此,目前尚未确定公开数据共享的最终方案。 然而,经完全去身份化的临床数据和人工智能模型评估结果,可能根据合理请求向提供方法学严谨方案的研究人员提供。 任何此类共享均须严格获得北京清华长庚医院机构审查委员会(IRB)的批准,并签署正式的数据共享协议。

药物和器械信息、研究文件

研究美国 FDA 监管的药品

不

研究美国 FDA 监管的设备产品

不

此信息直接从 clinicaltrials.gov 网站检索,没有任何更改。如果您有任何更改、删除或更新研究详细信息的请求,请联系 register@clinicaltrials.gov. clinicaltrials.gov 上实施更改,我们的网站上也会自动更新.

订阅