四个LLM在临床实践中的开放性安全性和比较功效
针对黄金标准医学参考的四种公开可用的大语言模型的比较性能评估
OpenIvence是一种在线工具,它汇总并合成了经过同行评审的医学研究的数据,然后使用Generative AI提出对用户问题的回答。 虽然当今许多临床医生(包括居民)正在使用它,但几乎没有关于该工具的输出是否准确以及该信息是否适当地为临床决策做出的数据。 同样,许多临床医生正在转向其他大型语言模型(LLM),以帮助提供临床护理时决策。 尽管已经发表了许多有关这些LLM对医疗委员会问题或临床小插曲的回答准确性的研究,但迄今为止,很少有研究在现实世界中研究其表现,而比较这种表现更少。
在这项研究中,研究人员有两个目标:
- 为了确定在临床实践过程中,在家庭医学,内科医学和精神病学居民使用时,使用AI工具“开放式”是否会导致临床适当的决定。
- 为了确定OpenIxidence工具的输出与其他三种常用的,公开可用的大语言模型(Openai's Chatgpt,Anthropic的Claude和Google的Gemini),以回答居民在临床实践中遇到的常见问题。
为了实现研究目标1,研究人员已将居民邀请上述专业,以在临床实践的过程中使用开放式工具。 为了减轻任何安全风险,居民还将为其问题使用典型的参考工具,该工具称为“金标准”工具。 这些工具包括PubMed和UpTodate。 居民将:
- 陈述他们的临床问题。
- 查询开放式,捕获其提示和开放式传动输出以进行数据分析。 在研究开始时,所有居民将接受迅速工程的培训。
- 根据开放式数据陈述其临床结论。
- 查询黄金标准资源。
- 陈述他们的最终临床结论。
- 回答一个问题,说明他们的临床结论是否通过黄金标准参考进行了修改。
- 回答一个问题,说明他们是否对OpenInper的产出有任何临床安全问题。
由专业与至少5年的培训后临床经验相匹配的医师主题专家(SME)将评估居民的反应。 马尔科姆·格拉德威尔(Malcolm Gladwell)选择了5年的《离群值》,他断言需要10,000小时的专注实践才能在一个领域中获得专业知识。
仅根据开放态度,将要求中小企业评估居民的最初临床问题及其结论。 他们将被要求以1-10的规模评估这些结论的临床适当性。 对于中小企业对居民结论的临床适当性的评价很差(<5/10)的问题(<5/10),他们将被要求审查OpenIfence的输出,并回答有关输出是否不正确或居民误解该工具的输出的其他问题。
为了实现目标2,研究小组将复制居民进入OpenIvidence的最初提示为Chatgpt,Gemini和Claude。 每个工具的输出(包括开放式)将浮出水面,中小企业将根据准确性,完整性和偏差来评估每个输出。 李克特量表将用于这些评分。 还将向中小企业提出一个开放式问题,以确定任何输出中的任何患者安全问题。
研究概览
详细说明
OpenIfcente是一种由5月诊所平台加速[OpenIvence]构建的在线工具,该工具汇总并合成了同行评审的医学研究中的数据,然后使用生成AI对用户的问题产生回答。 虽然当今许多临床医生(包括居民)正在使用它,但几乎没有关于该工具的输出是否准确以及该信息是否适当地为临床决策做出的数据。 同样,许多临床医生正在转向其他大型语言模型(LLM),以帮助提供临床护理时决策。
OpenIvence是一种在线工具,旨在从同行评审的临床研究中汇总和合成数据,随后通过应用AI的应用对用户查询产生响应。 尽管经验丰富的临床医生和学员都越来越多地使用,但仍有明显缺乏有关该工具产出的准确性的数据,它们在适当地告知临床决策方面的安全性和功效。 同时,越来越多的临床医生正在利用其他公开提供的大型语言模型(LLMS)来支持临床护理中的决策。 尽管许多研究研究了LLM对医疗委员会问题或临床小插曲的反应的准确性,但对它们在现实世界中的临床环境的表现的研究有限,甚至更少的研究提供了对此表现的比较分析。
在对文献的综述中,一篇文章表明,LLM在检测焦虑方面可能比从业者更好,但这是基于临床小插曲。 [Levkovich等人]另一种研究了结构化问卷中使用患者报告的结果指标来研究LLM的诊断敏感性。 [Pagano等人] 比较肿瘤学LLM的另一项研究还使用了虚构的小插曲。 [Benary等人] 使用临床小插图的随机对照试验没有显示出可以使用LLM的提供商的任何临床改进。 [Goh等人] 一项案例研究探索了Chatgpt 3.5的整合到每日回合中,并定性地评估了其使用,但没有将其与其他LLM或Gold Standard参考工具进行比较。 [Skryd等人]另一个比较了Chatgpt对美国放射学院适当性乳腺疼痛和乳腺癌筛查标准的反应,但又没有将其与其他LLM进行比较。 [Rao等人] 在我们的评论中,只有一项研究在现实世界中评估了LLM的临床环境。 这是一系列论文,研究了它们在乳腺癌护理中的复杂决策,使用少数实际情况和标准化的及时模板。 [Griewing,Knitza等人; Grewing,Gremke等。] 该研究发现,准确性的一致性和恶化(尤其是GPT 3.5)的问题,导致作者得出结论,在出版时,llm的临床使用为此目的尚不可行。 尽管如此,卫生系统领导者仍然看到了这些工具在临床实践中迅速加速的使用。 因此,调查人员认为,必须研究他们的安全性和临床医生使用的决定的临床适当性。
剑桥卫生联盟(CHA)是波士顿地区的公共学术安全网卫生系统,为多样化的患者服务。 CHA具有强大的初级保健和门诊精神病学足迹,并通过哈佛医学院和塔夫茨大学医学院支持大型研究生医学教育计划。 研究人员选择居民为我们的主要研究参与者,因为许多学员已经在使用开放式,并发现如果可以访问CHA的工具,则更激励他们参与研究(否则该工具被网络服务列入了黑名单,并由政策禁止,直到可以确定这项研究的结果)。
研究结果如下:
确定在社区健康环境中,在临床实践过程中,居民的使用是否会导致居民在临床上做出适当的决定。
确定开放式传播的产出与其他三种常用的,公开可用的大语言模型(OpenAI的Chatppt,人类的Claude和Google的Gemini)的准确性,完整性和偏见在解决临床问题时在社区健康环境中的临床实践中有所了解。
方法:
计划在6个月内进行数据收集,以最大程度地减少研究期间供应商版本的升级。 居民由专业分组为“医学”(内科/家庭医学)和“精神病学”(成人/儿童精神病学)。 为了简化与适当的专业主题专家的匹配,要求医学居民仅用于成人初级保健案件(不包括与OB/GYN相关的问题)。 精神病学居民仅用于成人精神病学病例。
在被接受为参与者之前,都要求学员同意以下内容:
- 交叉检查针对研究方案中定义的黄金标准工具的任何开放式查询,包括PubMed,Uptodate,Dynamed,临床专业社会指南或其他类似的临床参考来源,必须记录在研究形式中。
- 不将任何个人健康信息(PHI)输入OpenIvence(如下定义)。
- 如果适合患者的临床护理,则尝试每周至少3次使用开放式传播。
- 将100%的开放性查询记录到研究表中,以避免选择偏见。
在数据收集开始之前,所有居民将在及时的医疗保健中进行简短的培训。 标准化的提示将不使用,因为该研究的子目标之一是了解居民在现实世界中提交的Queries类型。
所有居民将接受有关PHI的定义的教育,如下所示:
查询不应包括安全港标识符[HHS]所定义的任何PHI;查询可以包括年龄(儿科的天数/周/月)和法律性行为的患者年龄;对于89岁或以上的患者,用户必须使用“超过89岁”一词来遵守安全港标准。
查询不应包括涉嫌患有极少数罕见疾病的患者,因为这些疾病也很容易重新识别[NORD]。 如果最初没有怀疑罕见的条件,而是通过使用AI工具的研究过程被怀疑,则将要求用户停止其查询。
数据收集将涉及在CHA的企业Google Google Workspace中使用符合HIPAA的Google形式,用于健康云基础架构。 数据收集表将询问受训者以下操作:
- 输入他们的最初临床问题。
- 粘贴其开放式提示(按迭代提示依次编号)和生成的完整开放向导输出。
- 根据开放式输出输入他们的临床结论。
- 输入使用的金标准参考工具。
- 根据OpenIvence和Gold Standard参考工具的信息,根据信息列出他们的最终临床结论。
- 回答一个问题,以通过黄金标准参考来修改其最初的临床结论的程度。
- 回答一个开放式问题,以了解他们是否注意到OpenICES的产出中的任何临床安全问题,不准确或偏见。
查询将通过专业(医学与精神病学)进行分类,每个查询都将收到一个顺序研究编号。
招募了内科医学,家庭医学或精神病学认证的医师主题专家(SMES)董事会,并至少拥有5年的培训后临床经验。 基于Malcolm Gladwell在他的书《 Outliers》中断言需要10,000个小时的专注实践来实现领域的专业知识,因此选择了五年的培训后临床经验。
仅根据开放态度,将要求中小企业评估居民的最初临床问题及其结论。 他们将被要求以10点李克特量表对这些结论的临床适当性进行评分。 SME还将为每个查询提供开放式进气输出,以及中小企业对居民结论的临床适当性的评价很差(<5/5/10),还会提出SME的临床适当性,以便将SME提出一个后续问题,以评估该工具的输出本身是否提供了临床上不适当的反应,以确定培训人员是否可以误解了该工具的输出。 中小型企业审查将包括审阅者之间的2.5-5%重叠,以计算Kappa分数的互置可靠性。
在研究的第二部分中,研究团队将对主题进行开放介绍查询,并从每个专业和主题中选择随机抽样,以进行LLM之间的比较。 研究小组确认,根据研究方案,提示不包括任何PHI。 然后,他们将复制居民输入的开放式提示以获取所选查询,并将其精确粘贴到Chatgpt,Gemini和Claude中。
Google WebForm中将浮出四个工具(开放式,Chatgpt,Gemini和Claude)的输出。 将要求中小企业以李克特量表的准确性,完整性和偏见来对每个输出进行评分,并回答一个定性问题,以识别输出中的任何患者安全问题。
结果:
主要结果结果将如下报告:
居民使用OpenIvence(平均SD,中位数)做出的决策的临床适当性,专业
- 如果在临床适当性较低的情况下,中小型企业确定这不是由于工具的输出而导致的,而是由于居民对工具的解释,则还将提供指标
- 间信性(Kappa值)
次要结果结果将如下报告:
对于每个专业和每个变量(准确,完整性和偏见),调查人员将报告:
- 每个LLM的“胜利”率和第二名得分的平均利润。
- 使用Cohen D测试的效果大小(使用每个LLM作为单独的参考)。
- 间信性(Kappa值)
研究类型
注册 (估计的)
联系人和位置
学习地点
-
-
Massachusetts
-
Cambridge、Massachusetts、美国、02193
- Cambridge Health Alliance
-
-
参与标准
资格标准
适合学习的年龄
- 孩子
- 成人
- 年长者
接受健康志愿者
取样方法
研究人群
描述
纳入标准:
- 活跃的学员PGY-1通过PGY-6在剑桥健康联盟的内科,家庭医学,成人精神病学或儿童精神病学领域的PGY-6
- 必须同意研究描述中概述的研究方案要求。
排除标准:
- 任何不符合纳入标准的人
- 计划在学习期结束之前离开CHA的居民。
学习计划
研究是如何设计的?
设计细节
队列和干预
团体/队列 |
干预/治疗 |
|---|---|
|
医学居民
内科或家庭医学学员
|
居民将在常规临床护理过程中使用开放式临床参考工具。
他们还必须使用金标准临床参考工具(例如
PubMed,uptodate),以减轻风险。
|
|
精神病学居民
成人和儿童精神病学的学员
|
居民将在常规临床护理过程中使用开放式临床参考工具。
他们还必须使用金标准临床参考工具(例如
PubMed,uptodate),以减轻风险。
|
研究衡量的是什么?
主要结果指标
结果测量 |
措施说明 |
大体时间 |
|---|---|---|
|
临床适当性:平均SD
大体时间:6个月
|
基于开放式导出的居民决策的临床适当性评分。 这是10点李克特量表上的数字得分。 (对于我们和我们所有结果指标中描述的李克特量表,更高的分数是更好的结果。) 标准偏差的平均得分将用于主要结果。 |
6个月
|
|
临床适当性:中位数
大体时间:6个月
|
基于开放式导出的居民决策的临床适当性评分。 这是10点李克特量表上的数字得分。 中位临床适当性评分也将报道。 |
6个月
|
|
Clinical Appropriateness: Intraclass Correlation Coefficient (ICC)
大体时间:6 months
|
SME's will evaluate Clinical Appropriateness scores of resident decisions based on OpenEvidence output on a 10-point Likert scale. Interclasscorrelation of SME Clinical Appropriateness scores will be calculated using Intraclass Correlation Coefficient (ICC) |
6 months
|
次要结果测量
结果测量 |
措施说明 |
大体时间 |
|---|---|---|
|
LLM的比较准确性:获胜率
大体时间:6个月
|
比较开放式,Chatgpt,Gemini和Claude的输出,中小型企业将对每个工具进行评分,以便在10分李克特量表上进行准确性。 无论哪种模型获胜,都将获得“ 1”的得分。 如果有领带,则每个取决于领带的划分,得到0.5或0.33点。 对于每个专业(医学和精神病学)和每个LLM,我们将报告“获胜率”,并以第二名LLM的平均利润率报告。 例如,对于所有医学查询,我们将在精确度列克特量表上(在确定Kappa值的SME重叠)上,在其他LLM上“赢得”的时间百分比“赢得”,我们将平均SME的得分)。 由于与准确性有关,我们将报告获胜率是一个百分比。 |
6个月
|
|
比较准确性:胜利的边缘
大体时间:6个月
|
比较开放式,Chatgpt,Gemini和Claude的输出,中小型企业将对每个工具进行评分,以便在10分李克特量表上进行准确性。 对于每个专业(医学和精神病学),我们将根据准确性计算每个LLM的获胜率,然后报告: 从第二位LLM的平均边距以提高准确性。
|
6个月
|
|
比较准确性:效果大小
大体时间:6个月
|
比较开放式,Chatgpt,Gemini和Claude的输出,中小型企业将对每个工具进行评分,以便在10分李克特量表上进行准确性。 对于每个专业(药物和精神病学),我们将使用Cohen的D测试来计算每个LLM的平均准确度得分的效果大小,而不是其他三个LLM。 效应大小为0.2很小,0.5是中等的,并且认为0.8被认为大。 |
6个月
|
|
LLM的比较完整性:获胜率
大体时间:6个月
|
比较开放式,Chatgpt,Gemini和Claude的输出,中小型企业将对每个工具进行评分以10点李克特量表的完成。 无论哪种模型获胜,都将获得“ 1”的得分。 如果有领带,则每个取决于领带的划分,得到0.5或0.33点。 对于每个专业(医学和精神病学)和每个LLM,我们将报告“获胜率”,并以第二名LLM的平均利润率报告。 例如,对于所有医学查询,我们将在精确度列克特量表上(在确定Kappa值的SME重叠)上,在其他LLM上“赢得”的时间百分比“赢得”,我们将平均SME的得分)。 由于与完整性有关,我们将报告获胜率为一个百分比。 |
6个月
|
|
比较完整性:胜利的边距
大体时间:6个月
|
比较开放式,Chatgpt,Gemini和Claude的输出,中小型企业将对每个工具进行评分,以便在10分李克特量表上进行准确性。 对于每个专业(医学和精神病学),我们将在完整性上计算每个LLM的获胜率,然后报告: 从第二名LLM的平均利润为完整性。
|
6个月
|
|
比较完整性:效果大小
大体时间:6个月
|
比较开放式,Chatgpt,Gemini和Claude的输出,中小型企业将对每个工具进行评分,以便在10分李克特量表上进行准确性。 对于每个专业(医学和精神病学),我们将使用Cohen D测试来计算每个LLM平均完整性得分的效果大小,而不是其他三个LLM。 效应大小为0.2很小,0.5是中等的,并且认为0.8被认为大。 |
6个月
|
|
LLM的比较偏见:获胜率
大体时间:6个月
|
比较开放式,Chatgpt,Gemini和Claude的输出,SME将对每个工具进行评分,以在10点Likert量表上以偏见的迹象。 无论哪种模型获胜,都将获得“ 1”的得分。 如果有领带,则每个取决于领带的划分,得到0.5或0.33点。 对于每个专业(医学和精神病学)和每个LLM,我们将报告“获胜率”,并以第二名LLM的平均利润率报告。 例如,对于所有医学查询,我们将在精确度列克特量表上(在确定Kappa值的SME重叠)上,在其他LLM上“赢得”的时间百分比“赢得”,我们将平均SME的得分)。 由于与偏见有关,我们将报告获胜率是一个百分比。 |
6个月
|
|
比较偏见:胜利的边缘
大体时间:6个月
|
比较开放式,Chatgpt,Gemini和Claude的输出,中小型企业将以10分李克特量表的偏差对每个工具进行评分。 对于每个专业(医学和精神病学),我们将计算每个LLM偏见的获胜率,然后报告: 偏差的平均利润率为LLM。
|
6个月
|
|
比较偏见:效果大小
大体时间:6个月
|
比较开放式,Chatgpt,Gemini和Claude的输出,中小型企业将对每个工具进行评分,以便在10分李克特量表上进行准确性。 对于每个专业(医学和精神病学),我们将使用Cohen的D测试来计算每个LLM平均偏差分数的效果大小,而不是其他三个LLM。 效应大小为0.2很小,0.5是中等的,并且认为0.8被认为大。 |
6个月
|
|
Comparative Accuracy of LLM's: Intraclass Correlation Coefficient (ICC)
大体时间:6 months
|
Comparing outputs of OpenEvidence, ChatGPT, Gemini, and Claude, SME's will rate each tool for accuracy on a 10-point Likert scale. Interclass correlation of Accuracy scores will be calculated using Intraclass Correlation Coefficient (ICC) |
6 months
|
|
Comparative Completeness of LLM's: Intraclass Correlation Coefficient (ICC)
大体时间:6 months
|
Comparing outputs of OpenEvidence, ChatGPT, Gemini, and Claude, SME's will rate each tool for accuracy on a 10-point Likert scale. Interclass correlation of Completeness scores will be calculated using Intraclass Correlation Coefficient (ICC). |
6 months
|
|
Comparative Bias of LLM's: Intraclass Correlation Coefficient (ICC)
大体时间:6 months
|
Comparing outputs of OpenEvidence, ChatGPT, Gemini, and Claude, SME's will rate each tool for accuracy on a 10-point Likert scale. Interclass of Bias scores will be calculated using Intraclass Correlation Coefficient (ICC). |
6 months
|
合作者和调查者
调查人员
- 首席研究员:Hannah K Galvin, MD、Cambridge Health Alliance
出版物和有用的链接
一般刊物
- Pagano S, Strumolo L, Michalk K, Schiegl J, Pulido LC, Reinhard J, Maderbacher G, Renkawitz T, Schuster M. Evaluating ChatGPT, Gemini and other Large Language Models (LLMs) in orthopaedic diagnostics: A prospective clinical study. Comput Struct Biotechnol J. 2024 Dec 26;28:9-15. doi: 10.1016/j.csbj.2024.12.013. eCollection 2025.
- Skryd A, Lawrence K. ChatGPT as a Tool for Medical Education and Clinical Decision-Making on the Wards: Case Study. JMIR Form Res. 2024 May 8;8:e51346. doi: 10.2196/51346.
- Rao A, Kim J, Kamineni M, Pang M, Lie W, Dreyer KJ, Succi MD. Evaluating GPT as an Adjunct for Radiologic Decision Making: GPT-4 Versus GPT-3.5 in a Breast Imaging Pilot. J Am Coll Radiol. 2023 Oct;20(10):990-997. doi: 10.1016/j.jacr.2023.05.003. Epub 2023 Jun 21.
- Levkovich I, Rabin E, Brann M, Elyoseph Z. Large language models outperform general practitioners in identifying complex cases of childhood anxiety. Digit Health. 2024 Dec 15;10:20552076241294182. doi: 10.1177/20552076241294182. eCollection 2024 Jan-Dec.
- Griewing S, Knitza J, Boekhoff J, Hillen C, Lechner F, Wagner U, Wallwiener M, Kuhn S. Evolution of publicly available large language models for complex decision-making in breast cancer care. Arch Gynecol Obstet. 2024 Jul;310(1):537-550. doi: 10.1007/s00404-024-07565-4. Epub 2024 May 29.
- Benary M, Wang XD, Schmidt M, Soll D, Hilfenhaus G, Nassir M, Sigler C, Knodler M, Keller U, Beule D, Keilholz U, Leser U, Rieke DT. Leveraging Large Language Models for Decision Support in Personalized Oncology. JAMA Netw Open. 2023 Nov 1;6(11):e2343689. doi: 10.1001/jamanetworkopen.2023.43689.
研究记录日期
研究主要日期
学习开始 (实际的)
初级完成 (实际的)
研究完成 (估计的)
研究注册日期
首次提交
首先提交符合 QC 标准的
首次发布 (实际的)
研究记录更新
最后更新发布 (实际的)
上次提交的符合 QC 标准的更新
最后验证
更多信息
与本研究相关的术语
其他研究编号
- CHA-IRB-25-26-444
计划个人参与者数据 (IPD)
计划共享个人参与者数据 (IPD)?
IPD 计划说明
药物和器械信息、研究文件
研究美国 FDA 监管的药品
研究美国 FDA 监管的设备产品
此信息直接从 clinicaltrials.gov 网站检索,没有任何更改。如果您有任何更改、删除或更新研究详细信息的请求,请联系 register@clinicaltrials.gov. clinicaltrials.gov 上实施更改,我们的网站上也会自动更新.