此页面是自动翻译的,不保证翻译的准确性。请参阅 英文版 对于源文本。

在手术中使用CHATGPT-4评估决策 (EDuCATe)

2025年4月8日 更新者:Manuela Mastronardi、Ospedali Riuniti Trieste

评估Chatgpt-4作为手术学员的决策支持工具

这项研究旨在评估ChatGpt-4是否可以支持临床决策中的手术学员。 通过将Chatgpt-4的表现与初级居民,高级居民以及参加标准化临床方案的外科医生的表现,该研究旨在了解大语言模型在手术教育中的潜在作用。 最终目标是评估ChatGpt-4是否可以安全地集成为补充教育工具,以帮助初级居民发展批判性思维和手术判断。

研究概览

地位

尚未招聘

详细说明

背景:

人工智能(AI)正在迅速改变医疗景观,提供教育,诊断和决策支持方面的新可能性。 在手术中,临床决策是通过培训逐步发展的核心竞争力。 由OpenAI开发的最先进的大语言模型Chatgpt-4已经证明了处理医疗查询和临床推理任务的能力。 但是,与人类学员相比,它在复杂的手术决策中的表现仍然在很大程度上尚未探索。

客观的:

教育研究旨在评估Chatgpt-4对涉及通用手术病例的临床情况的反应的准确性和可靠性。 具体而言,该研究将模型的表现与初级居民,高级居民和参加外科医生的表现进行了比较,以了解Chatgpt-4是否可以作为手术学员的安全有效的教育工具。

方法:

将使用代表常规手术状况的实际匿名患者数据来构建七个临床情况。 每个案例将逐步介绍,模仿临床决策过程。 参与者将回答与治疗选择有关的问题。

参与者将包括初级居民(PGY1-2),高级居民(PGY3+​​),并参加了一个外科手术部门的外科医生。 Chatgpt-4将采用相同的方案提示。 所有参与者将被指示在不使用外部资源(例如AI工具或Internet搜索)的情况下完成案件,仅依靠他们的临床知识。

统计分析将使用非参数测试(例如Wilcoxon等级总和)比较各组的性能。

预期的结果:

该研究假设Chatgpt-4的表现将与高级居民或参加外科医生和大三居民在决策方面的表现相当。 如果得到证实,这些结果可以支持将ChatGpt-4作为对初级外科居民的培训辅助,从而有可能提高教育成果和临床推理技能。

意义:

这项研究将为AI在手术教育中的作用提供新颖的见解。 通过严格将Chatgpt-4的决策能力与不同级别的人类外科医生的决策能力进行比较,该研究希望定义其效用,限制和适当的居住培训计划中的使用。

研究类型

观察性的

注册 (估计的)

35

联系人和位置

本节提供了进行研究的人员的详细联系信息,以及有关进行该研究的地点的信息。

学习联系方式

学习地点

      • Trieste、意大利
        • University of Trieste
        • 接触:
        • 首席研究员:
          • Silvia Palmisano
        • 首席研究员:
          • Manuela Mastronardi
        • 副研究员:
          • Paola Germani
        • 副研究员:
          • Margherita Sandano

参与标准

研究人员寻找符合特定描述的人,称为资格标准。这些标准的一些例子是一个人的一般健康状况或先前的治疗。

资格标准

适合学习的年龄

  • 孩子
  • 成人
  • 年长者

接受健康志愿者

不

取样方法

非概率样本

研究人群

研究人群将包括一家学术外科手术系的普通手术学员和教职员工。 参与者将根据他们的培训和经验水平将参与者分为三组:初级居民:研究生年(PGY)1-2;高级居民:PGY 3及以上;参加外科医生:具有独立临床实践的董事会认证的一般外科医生

描述

纳入标准:

  • 在参与机构的一般手术居住或部门中积极入学或雇用
  • 愿意参加并完成所有临床情况
  • 同意参加研究

排除标准:

  • 反应不完整
  • 在回答方案时,使用外部帮助(例如,互联网搜索,AI工具),在说明中自我报告

学习计划

本节提供研究计划的详细信息,包括研究的设计方式和研究的衡量标准。

研究是如何设计的?

设计细节

队列和干预

团体/队列
干预/治疗
居民
一般手术的初级和高级居民
七个必须分析的临床病例
顾问
高级外科医生
七个必须分析的临床病例
Chatgpt 4
人工智能系统
七个必须分析的临床病例

研究衡量的是什么?

主要结果指标

结果测量
措施说明
大体时间
正确响应的比例
大体时间:基线
二进制结果(正确与错误的决定)
基线

次要结果测量

结果测量
措施说明
大体时间
比较跨经验水平的准确性
大体时间:基线
小组正确答复的比例:初级居民,高级居民,参加外科医生,Chatgpt-4
基线
信心水平
大体时间:基线
要求参与者和Chatgpt对他们的答案(1-5李克特量表,其中1表示自信,5都非常自信)评分他们的自信心。
基线
AI在临床病例评估中的使用百分比
大体时间:基线
询问参与者是否在临床活动中使用是否使用
基线

合作者和调查者

在这里您可以找到参与这项研究的人员和组织。

研究记录日期

这些日期跟踪向 ClinicalTrials.gov 提交研究记录和摘要结果的进度。研究记录和报告的结果由国家医学图书馆 (NLM) 审查,以确保它们在发布到公共网站之前符合特定的质量控制标准。

研究主要日期

学习开始 (估计的)

2025年4月10日

初级完成 (估计的)

2025年4月25日

研究完成 (估计的)

2025年4月30日

研究注册日期

首次提交

2025年4月2日

首先提交符合 QC 标准的

2025年4月8日

首次发布 (实际的)

2025年4月10日

研究记录更新

最后更新发布 (实际的)

2025年4月10日

上次提交的符合 QC 标准的更新

2025年4月8日

最后验证

2025年4月1日

更多信息

与本研究相关的术语

其他研究编号

  • AI-Surgical training

计划个人参与者数据 (IPD)

计划共享个人参与者数据 (IPD)?

不

药物和器械信息、研究文件

研究美国 FDA 监管的药品

不

研究美国 FDA 监管的设备产品

不

此信息直接从 clinicaltrials.gov 网站检索,没有任何更改。如果您有任何更改、删除或更新研究详细信息的请求,请联系 register@clinicaltrials.gov. clinicaltrials.gov 上实施更改,我们的网站上也会自动更新.

订阅