- ICH GCP
- Registro de ensayos clínicos de EE. UU.
- Ensayo clínico NCT06911645
Razonamiento de diagnóstico con modelo GPT-4 personalizado
Evaluación del rendimiento de LLM y médicos en casos de diagnóstico complejos: un ensayo controlado aleatorio
Descripción general del estudio
Estado
Condiciones
Descripción detallada
Las tecnologías de inteligencia artificial (IA), particularmente modelos de idiomas grandes avanzados como ChatGPT de OpenAi, tienen el potencial de mejorar la toma de decisiones médicas. Si bien ChatGPT-4 no fue diseñado específicamente para aplicaciones médicas, ha demostrado promesa en varios contextos de salud, incluida la escritura de notas médicas, abordar las consultas de los pacientes y facilitar consultas médicas. Sin embargo, su impacto en el razonamiento de diagnóstico de los médicos sigue siendo en gran medida desconocido.
El razonamiento clínico es un proceso complejo que implica el reconocimiento de patrones, la aplicación de conocimiento y el razonamiento probabilístico. La integración de herramientas de IA como ChatGPT-4 en los flujos de trabajo del médico podría ayudar a reducir la carga de trabajo del médico y disminuir la probabilidad de diagnósticos perdidos. Sin embargo, ChatGPT-4 no fue desarrollado ni validado para el razonamiento de diagnóstico, y puede producir información engañosa, incluidas conclusiones plausibles pero incorrectas que podrían maldecir a los médicos. Si no se usa de manera adecuada, puede dejar de mejorar e incluso podría obstaculizar la toma de decisiones clínicas. Por lo tanto, es esencial estudiar cómo los médicos usan modelos de idiomas grandes para apoyar el razonamiento clínico antes de integrarlos en la atención de rutina del paciente.
Este estudio examinará cómo el acceso inmediato a una versión personalizada de ChatGPT-4 impacta el rendimiento en las tareas de razonamiento de diagnóstico basadas en casos, en comparación con un enfoque gradual. En el enfoque gradual, los participantes primero utilizarán las herramientas de soporte de decisiones de diagnóstico tradicionales para respaldar su razonamiento de casos antes de interactuar con un modelo CHATGPT-4 personalizado, momento en el cual tendrán la oportunidad de revisar sus respuestas iniciales.
Los participantes serán aleatorizados en diferentes brazos de estudio y responderán a casos de diagnóstico proporcionando tres diagnósticos diferenciales, junto con hallazgos de apoyo y oposición para cada uno. También identificarán su diagnóstico superior y propondrán los próximos pasos de diagnóstico. Los revisores independientes, cegados a la asignación de tratamiento, evaluarán sus respuestas.
Tipo de estudio
Inscripción (Actual)
Fase
- No aplica
Contactos y Ubicaciones
Ubicaciones de estudio
-
-
California
-
Palo Alto, California, Estados Unidos, 94305
- Stanford University
-
-
Criterios de participación
Criterio de elegibilidad
Edades elegibles para estudiar
- Niño
- Adulto
- Adulto Mayor
Acepta Voluntarios Saludables
Descripción
Criterios de inclusión:
- Los participantes deben ser médicos con licencia y han completado al menos el año 1 de grado 1 (PGY1) de capacitación médica.
- Capacitación en medicina interna, medicina familiar o medicina de emergencia.
Criterios de exclusión:
- Actualmente no practica clínicamente.
- Participó en uno de nuestros estudios anteriores que utilizó los mismos seis casos de diagnóstico.
Plan de estudios
¿Cómo está diseñado el estudio?
Detalles de diseño
- Propósito principal: Diagnóstico
- Asignación: Aleatorizado
- Modelo Intervencionista: Asignación paralela
- Enmascaramiento: Único
Armas e Intervenciones
Grupo de participantes/brazo |
Intervención / Tratamiento |
|---|---|
|
Comparador activo: Acceso inmediato a la versión personalizada de GPT-4
Se alentará al grupo a usar inmediatamente una versión personalizada de GPT-4.
|
El grupo tiene acceso inmediato a una versión personalizada de GPT-4 para respaldar su razonamiento de diagnóstico para cada caso.
|
|
Comparador activo: Recursos convencionales primero, luego otorgaron acceso a la versión personalizada de GPT-4.
Se alentará al grupo que primero use los recursos que deseen además de modelos de idiomas grandes (UpTodate, PubMed, Google, etc.) y luego se le otorgará acceso a una versión personalizada de GPT-4.
|
Primero se alienta al grupo a razonar a través de casos de diagnóstico con el apoyo de los recursos convencionales.
Después de enviar las respuestas de un caso, luego se les da acceso a una versión personalizada de GPT-4 y tienen la oportunidad de cambiar sus respuestas iniciales.
|
¿Qué mide el estudio?
Medidas de resultado primarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Razonamiento diagnóstico
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
|
El resultado primario será el porcentaje de respuestas correctas por caso (rango: 0 a 100).
Para cada caso, se les pedirá a los participantes que proporcionen sus tres diagnósticos diferenciales principales, junto con hallazgos de apoyo y oposición para cada uno.
Recibirán 1 punto para cada diagnóstico plausible.
Los hallazgos de apoyo y opuesto se calificarán en función de la corrección, con 1 punto para una respuesta parcialmente correcta y 2 puntos para una respuesta completamente correcta.
Luego, los participantes seleccionarán su diagnóstico superior, ganando 1 punto para una opción razonable y 2 puntos para el diagnóstico más preciso.
Finalmente, enumerarán hasta tres próximos pasos para más evaluación del paciente, con 1 punto otorgado por una respuesta parcialmente correcta y 2 puntos para una respuesta completamente correcta.
El resultado primario se analizará a nivel de caso, comparando el rendimiento entre los grupos de estudio aleatorios.
|
A través de la finalización del estudio, un promedio de 6 meses
|
Medidas de resultado secundarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Tiempo dedicado por caso
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
|
Los investigadores compararán el tiempo promedio (en minutos) que los participantes gastan en cada caso en los dos brazos de estudio.
|
A través de la finalización del estudio, un promedio de 6 meses
|
|
Frecuencia rápida
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
|
Los investigadores compararán la frecuencia de las indicaciones participantes con el modelo GPT-4 personalizado entre los dos grupos de estudio.
|
A través de la finalización del estudio, un promedio de 6 meses
|
|
Sentimiento
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
|
Los investigadores compararán el tono y el sentimiento de las indicaciones participantes con el modelo GPT-4 personalizado en los dos grupos de estudio.
Los investigadores crearán un sistema de codificación cualitativa para clasificar la naturaleza de las indicaciones de los participantes.
|
A través de la finalización del estudio, un promedio de 6 meses
|
|
Percepciones participantes de IA en el razonamiento clínico
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
|
Este resultado se evaluaría en ambos brazos de estudio y abarcaría los cambios en las actitudes, la confianza y la voluntad de usar herramientas de diagnóstico de IA antes y después de ser expuesta a la herramienta personalizada.
Evaluaremos el número de participantes que estuvieron abiertos al uso de AI para ayudar con un razonamiento clínico complejo (antes y después del cuenco), si disfrutaban trabajar con la herramienta de diagnóstico de IA, si sentí que la herramienta proporcionaba una valiosa experiencia colaborativa para el razonamiento clínico, si ver las recomendaciones de Diagnóstico de AI aumentaba su confianza en su estudio de confianza.
Estos serán evaluados en una clasificación de la escala Likert desde muy en desacuerdo hasta que estén totalmente de acuerdo.
|
A través de la finalización del estudio, un promedio de 6 meses
|
|
Razonamiento de diagnóstico personalizado de GPT-4
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
|
Los diagnósticos "independientes" personalizados de GPT-4 se evaluarán por precisión.
El resultado será el porcentaje de respuestas correctas por caso (rango: 0 a 100).
Para cada caso, el Meta-PrompT dirige el GPT-4 personalizado para proporcionar sus tres diagnósticos diferenciales principales, junto con hallazgos de apoyo y oposición para cada uno, un diagnóstico final y los próximos pasos.
El GPT-4 personalizado recibirá 1 punto para cada diagnóstico plausible.
Los hallazgos de apoyo y opuesto se calificarán en función de la corrección, con 1 punto para una respuesta parcialmente correcta y 2 puntos para una respuesta completamente correcta.
Su diagnóstico superior ganará 1 punto para una opción razonable y 2 puntos para el diagnóstico más preciso.
Finalmente, enumerará hasta tres próximos pasos para más evaluación del paciente, con 1 punto otorgado por una respuesta parcialmente correcta y 2 puntos para una respuesta completamente correcta.
El resultado se analizará a nivel de caso, comparando el rendimiento con las puntuaciones de los grupos de estudio aleatorizados.
|
A través de la finalización del estudio, un promedio de 6 meses
|
Colaboradores e Investigadores
Patrocinador
Colaboradores
Investigadores
- Investigador principal: Jonathan H Chen, MD, PhD, Stanford University
Fechas de registro del estudio
Fechas importantes del estudio
Inicio del estudio (Actual)
Finalización primaria (Actual)
Finalización del estudio (Actual)
Fechas de registro del estudio
Enviado por primera vez
Primero enviado que cumplió con los criterios de control de calidad
Publicado por primera vez (Actual)
Actualizaciones de registros de estudio
Última actualización publicada (Actual)
Última actualización enviada que cumplió con los criterios de control de calidad
Última verificación
Más información
Términos relacionados con este estudio
Palabras clave
Términos MeSH relevantes adicionales
Otros números de identificación del estudio
- 71319c
Plan de datos de participantes individuales (IPD)
¿Planea compartir datos de participantes individuales (IPD)?
Información sobre medicamentos y dispositivos, documentos del estudio
Estudia un producto farmacéutico regulado por la FDA de EE. UU.
Estudia un producto de dispositivo regulado por la FDA de EE. UU.
producto fabricado y exportado desde los EE. UU.
Esta información se obtuvo directamente del sitio web clinicaltrials.gov sin cambios. Si tiene alguna solicitud para cambiar, eliminar o actualizar los detalles de su estudio, comuníquese con register@clinicaltrials.gov. Tan pronto como se implemente un cambio en clinicaltrials.gov, también se actualizará automáticamente en nuestro sitio web. .