此页面是自动翻译的,不保证翻译的准确性。请参阅 英文版 对于源文本。

人工智能驱动的神经病学紧急分诊虚拟助手 (AIDEN)

实施人工智能驱动的神经科紧急分诊虚拟助理的第一阶段试验

这项研究探讨了使用人工智能驱动的虚拟助手来快速识别和处理神经系统紧急情况,特别是在医疗资源有限的地方。 该研究旨在检查该人工智能工具是否足够安全和​​准确,可以进入更高级的测试阶段。 在一项史无前例的试验中,虚拟助手在患有紧急神经系统问题的患者身上进行了测试。 神经科医生首先使用临床记录审查人工智能的建议,然后直接与患者评估其表现。 结果如下:神经科医生几乎一直同意人工智能的决定,并且人工智能在每个测试方面都优于早期版本的 Chat GPT。 患者和医生发现人工智能非常有效,在大多数情况下将其评为优秀或非常好。 这表明人工智能可以显着提高处理神经紧急情况的速度和准确性,尽管在广泛使用之前还需要进一步的试验。

研究概览

详细说明

背景和目标:神经系统紧急情况对医疗保健提出了重大挑战,特别是在资源有限的国家。 人工智能(AI),特别是健康聊天机器人,提供了一个有前途的解决方案。 然而,需要严格的验证以确保安全性和准确性。 我们工作的目标是评估专为紧急神经病理学分类而设计的人工智能虚拟助手的诊断准确性和分辨率有效性,以确保允许进行连续验证测试的最低安全标准。

方法:这一第一阶段试验评估了人工智能驱动的虚拟助理在紧急神经系统分诊中的性能。 选择了 10 名 18 岁以上患有紧急神经病变的患者。 在第一阶段,九名神经科医生利用他们的临床记录评估了虚拟助手的安全性。 第二部分评估了患者使用助手时的准确性。 最后,将其性能与Chat GPT 3.5和4进行了比较。

研究类型

介入性

注册 (实际的)

10

阶段

  • 第一阶段早期

联系人和位置

本节提供了进行研究的人员的详细联系信息,以及有关进行该研究的地点的信息。

学习地点

      • Buenos Aires、阿根廷、1428
        • Fleni

参与标准

研究人员寻找符合特定描述的人,称为资格标准。这些标准的一些例子是一个人的一般健康状况或先前的治疗。

资格标准

适合学习的年龄

  • 成人
  • 年长者

接受健康志愿者

不

描述

纳入标准:

  • 因神经系统紧急情况而在急诊室就诊的 18 岁以上患者

排除标准:

  • 怀孕

学习计划

本节提供研究计划的详细信息,包括研究的设计方式和研究的衡量标准。

研究是如何设计的?

设计细节

  • 主要用途:诊断
  • 分配:非随机化
  • 介入模型:单组作业
  • 屏蔽:无(打开标签)

武器和干预

参与者组/臂
干预/治疗
实验性的:虚拟助理
患者通过虚拟助理回答有关他们最近去急诊室就诊的问题。
第一阶段侧重于安全性,仅使用虚拟助手的临床记录中的医疗信息。 在评估准确性的第二阶段,参与者在医疗稳定后与虚拟助手进行互动。 此外,参与者还提供了 Chat-GPT 输入的初始症状详细信息。 九名专门从事急诊的神经科医生参与了这项研究。 在第一阶段,他们使用临床病史信息评估虚拟助理的表现。 在第二阶段,他们分析了参与者与助手交互的结果,并对 Chat-GPT 进行了比较评估。 该虚拟助手充当 WhatsApp 和 Telegram 上的聊天机器人,使用西班牙语并结合了先进的算法、决策树和大型语言模型进行交互。 为了进行比较,我们使用 Chat-GPT 版本 3.5 和 4,采用两种自然西班牙语提示类型:一种包含临床记录数据,另一种基于参与者叙述。
有源比较器:聊天GPT 3.5
患者通过 ChatGPT 回答有关他们最近去急诊室就诊的问题。
第一阶段侧重于安全性,仅使用虚拟助手的临床记录中的医疗信息。 在评估准确性的第二阶段,参与者在医疗稳定后与虚拟助手进行互动。 此外,参与者还提供了 Chat-GPT 输入的初始症状详细信息。 九名专门从事急诊的神经科医生参与了这项研究。 在第一阶段,他们使用临床病史信息评估虚拟助理的表现。 在第二阶段,他们分析了参与者与助手交互的结果,并对 Chat-GPT 进行了比较评估。 该虚拟助手充当 WhatsApp 和 Telegram 上的聊天机器人,使用西班牙语并结合了先进的算法、决策树和大型语言模型进行交互。 为了进行比较,我们使用 Chat-GPT 版本 3.5 和 4,采用两种自然西班牙语提示类型:一种包含临床记录数据,另一种基于参与者叙述。
有源比较器:聊天GPT 4
患者通过 ChatGPT 回答有关他们最近去急诊室就诊的问题。
第一阶段侧重于安全性,仅使用虚拟助手的临床记录中的医疗信息。 在评估准确性的第二阶段,参与者在医疗稳定后与虚拟助手进行互动。 此外,参与者还提供了 Chat-GPT 输入的初始症状详细信息。 九名专门从事急诊的神经科医生参与了这项研究。 在第一阶段,他们使用临床病史信息评估虚拟助理的表现。 在第二阶段,他们分析了参与者与助手交互的结果,并对 Chat-GPT 进行了比较评估。 该虚拟助手充当 WhatsApp 和 Telegram 上的聊天机器人,使用西班牙语并结合了先进的算法、决策树和大型语言模型进行交互。 为了进行比较,我们使用 Chat-GPT 版本 3.5 和 4,采用两种自然西班牙语提示类型:一种包含临床记录数据,另一种基于参与者叙述。

研究衡量的是什么?

主要结果指标

结果测量
措施说明
大体时间
诊断性能
大体时间:参与者和虚拟助理之间的第一次互动发生在活动结束后不到一年的时间里。在患者与虚拟助理互动后立即评估结果指标。

指医学测试或诊断工具正确识别患者疾病或状况的准确性和有效性。

综合症诊断一致性:当人工智能工具可以根据一组常见的共存体征和症状来识别病症,而不是识别特定的疾病时,评估神经科医生认为综合症诊断是准确的。 当无法立即识别导致症状的确切疾病时,可以应用此方法,从而使医疗保健提供者能够有效监测和治疗患者出现的症状。

鉴别诊断一致性:当每个人工智能工具提供的差异与参与者提出的差异相匹配时,鉴别诊断被认为是准确的。

诊断的金标准被认为是急诊室给出的标准,在一个月内保持不变。

参与者和虚拟助理之间的第一次互动发生在活动结束后不到一年的时间里。在患者与虚拟助理互动后立即评估结果指标。

次要结果测量

结果测量
措施说明
大体时间
适当的医疗行为或建议
大体时间:参与者和虚拟助理之间的第一次互动发生在活动结束后不到一年的时间里。在患者与虚拟助理互动后立即评估结果指标。

根据适当的医疗行为或建议评估病例解决情况,分类为 1) 紧急,2) 短期(48 小时内),3) 或非紧急。

每个人工智能工具提供的建议都是根据从临床病史收集的信息和参与者的输入进行评估的。

适当医疗行为或建议的黄金标准被认为是在急诊室给出的,并且在一个月内没有变化。

参与者和虚拟助理之间的第一次互动发生在活动结束后不到一年的时间里。在患者与虚拟助理互动后立即评估结果指标。
可用性和满意度评估
大体时间:参与者和虚拟助理之间的第一次互动发生在活动结束后不到一年的时间里。在患者与虚拟助理互动后立即评估结果指标。

可用性是通过神经科医生和参与者最终诊断和解决所需的时间和问题数量来衡量的。 对于 Chat GPT,我们评估了起草咨询理由所需的时间。

实施了从 1 到 5 的满意度量表,其中 1 表示负面体验(“差”,对患者有潜在风险),5 表示高度正面(“优秀”,可能超过非专业人类分类)。 还对参与者进行了简单的是/否调查,询问助理问题的可理解性、根据紧急程度转介的充分性,以及他们是否认为助理可以取代非专业分诊或减少紧急到达时间。

参与者和虚拟助理之间的第一次互动发生在活动结束后不到一年的时间里。在患者与虚拟助理互动后立即评估结果指标。

合作者和调查者

在这里您可以找到参与这项研究的人员和组织。

合作者

调查人员

  • 首席研究员:Mauricio F Farez, MD MPH、Fundación para la lucha contra las enfermedades neurológicas de la infancia

出版物和有用的链接

负责输入研究信息的人员自愿提供这些出版物。这些可能与研究有关。

研究记录日期

这些日期跟踪向 ClinicalTrials.gov 提交研究记录和摘要结果的进度。研究记录和报告的结果由国家医学图书馆 (NLM) 审查,以确保它们在发布到公共网站之前符合特定的质量控制标准。

研究主要日期

学习开始 (实际的)

2023年10月1日

初级完成 (实际的)

2024年1月1日

研究完成 (实际的)

2024年1月1日

研究注册日期

首次提交

2024年3月6日

首先提交符合 QC 标准的

2024年3月21日

首次发布 (实际的)

2024年3月28日

研究记录更新

最后更新发布 (实际的)

2024年3月28日

上次提交的符合 QC 标准的更新

2024年3月21日

最后验证

2024年3月1日

更多信息

此信息直接从 clinicaltrials.gov 网站检索,没有任何更改。如果您有任何更改、删除或更新研究详细信息的请求,请联系 register@clinicaltrials.gov. clinicaltrials.gov 上实施更改,我们的网站上也会自动更新.

订阅