Esta página se tradujo automáticamente y no se garantiza la precisión de la traducción. por favor refiérase a versión inglesa para un texto fuente.

Razonamiento de diagnóstico con modelo GPT-4 personalizado

27 de marzo de 2025 actualizado por: Jonathan Chen, Stanford University

Evaluación del rendimiento de LLM y médicos en casos de diagnóstico complejos: un ensayo controlado aleatorio

Este estudio evaluará el impacto del acceso inmediato a una versión personalizada de GPT-4, un modelo de lenguaje grande, en el rendimiento en las tareas de razonamiento de diagnóstico basadas en casos. Específicamente, comparará este enfoque con un proceso de dos pasos donde los participantes usan primero las herramientas tradicionales de soporte de decisiones de diagnóstico para respaldar su razonamiento de diagnóstico antes de obtener acceso al modelo GPT-4 personalizado.

Descripción general del estudio

Descripción detallada

Las tecnologías de inteligencia artificial (IA), particularmente modelos de idiomas grandes avanzados como ChatGPT de OpenAi, tienen el potencial de mejorar la toma de decisiones médicas. Si bien ChatGPT-4 no fue diseñado específicamente para aplicaciones médicas, ha demostrado promesa en varios contextos de salud, incluida la escritura de notas médicas, abordar las consultas de los pacientes y facilitar consultas médicas. Sin embargo, su impacto en el razonamiento de diagnóstico de los médicos sigue siendo en gran medida desconocido.

El razonamiento clínico es un proceso complejo que implica el reconocimiento de patrones, la aplicación de conocimiento y el razonamiento probabilístico. La integración de herramientas de IA como ChatGPT-4 en los flujos de trabajo del médico podría ayudar a reducir la carga de trabajo del médico y disminuir la probabilidad de diagnósticos perdidos. Sin embargo, ChatGPT-4 no fue desarrollado ni validado para el razonamiento de diagnóstico, y puede producir información engañosa, incluidas conclusiones plausibles pero incorrectas que podrían maldecir a los médicos. Si no se usa de manera adecuada, puede dejar de mejorar e incluso podría obstaculizar la toma de decisiones clínicas. Por lo tanto, es esencial estudiar cómo los médicos usan modelos de idiomas grandes para apoyar el razonamiento clínico antes de integrarlos en la atención de rutina del paciente.

Este estudio examinará cómo el acceso inmediato a una versión personalizada de ChatGPT-4 impacta el rendimiento en las tareas de razonamiento de diagnóstico basadas en casos, en comparación con un enfoque gradual. En el enfoque gradual, los participantes primero utilizarán las herramientas de soporte de decisiones de diagnóstico tradicionales para respaldar su razonamiento de casos antes de interactuar con un modelo CHATGPT-4 personalizado, momento en el cual tendrán la oportunidad de revisar sus respuestas iniciales.

Los participantes serán aleatorizados en diferentes brazos de estudio y responderán a casos de diagnóstico proporcionando tres diagnósticos diferenciales, junto con hallazgos de apoyo y oposición para cada uno. También identificarán su diagnóstico superior y propondrán los próximos pasos de diagnóstico. Los revisores independientes, cegados a la asignación de tratamiento, evaluarán sus respuestas.

Tipo de estudio

Intervencionista

Inscripción (Actual)

70

Fase

  • No aplica

Contactos y Ubicaciones

Esta sección proporciona los datos de contacto de quienes realizan el estudio e información sobre dónde se lleva a cabo este estudio.

Ubicaciones de estudio

    • California
      • Palo Alto, California, Estados Unidos, 94305
        • Stanford University

Criterios de participación

Los investigadores buscan personas que se ajusten a una determinada descripción, denominada criterio de elegibilidad. Algunos ejemplos de estos criterios son el estado de salud general de una persona o tratamientos previos.

Criterio de elegibilidad

Edades elegibles para estudiar

  • Niño
  • Adulto
  • Adulto Mayor

Acepta Voluntarios Saludables

Sí

Descripción

Criterios de inclusión:

  • Los participantes deben ser médicos con licencia y han completado al menos el año 1 de grado 1 (PGY1) de capacitación médica.
  • Capacitación en medicina interna, medicina familiar o medicina de emergencia.

Criterios de exclusión:

  • Actualmente no practica clínicamente.
  • Participó en uno de nuestros estudios anteriores que utilizó los mismos seis casos de diagnóstico.

Plan de estudios

Esta sección proporciona detalles del plan de estudio, incluido cómo está diseñado el estudio y qué mide el estudio.

¿Cómo está diseñado el estudio?

Detalles de diseño

  • Propósito principal: Diagnóstico
  • Asignación: Aleatorizado
  • Modelo Intervencionista: Asignación paralela
  • Enmascaramiento: Único

Armas e Intervenciones

Grupo de participantes/brazo
Intervención / Tratamiento
Comparador activo: Acceso inmediato a la versión personalizada de GPT-4
Se alentará al grupo a usar inmediatamente una versión personalizada de GPT-4.
El grupo tiene acceso inmediato a una versión personalizada de GPT-4 para respaldar su razonamiento de diagnóstico para cada caso.
Comparador activo: Recursos convencionales primero, luego otorgaron acceso a la versión personalizada de GPT-4.
Se alentará al grupo que primero use los recursos que deseen además de modelos de idiomas grandes (UpTodate, PubMed, Google, etc.) y luego se le otorgará acceso a una versión personalizada de GPT-4.
Primero se alienta al grupo a razonar a través de casos de diagnóstico con el apoyo de los recursos convencionales. Después de enviar las respuestas de un caso, luego se les da acceso a una versión personalizada de GPT-4 y tienen la oportunidad de cambiar sus respuestas iniciales.

¿Qué mide el estudio?

Medidas de resultado primarias

Medida de resultado
Medida Descripción
Periodo de tiempo
Razonamiento diagnóstico
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
El resultado primario será el porcentaje de respuestas correctas por caso (rango: 0 a 100). Para cada caso, se les pedirá a los participantes que proporcionen sus tres diagnósticos diferenciales principales, junto con hallazgos de apoyo y oposición para cada uno. Recibirán 1 punto para cada diagnóstico plausible. Los hallazgos de apoyo y opuesto se calificarán en función de la corrección, con 1 punto para una respuesta parcialmente correcta y 2 puntos para una respuesta completamente correcta. Luego, los participantes seleccionarán su diagnóstico superior, ganando 1 punto para una opción razonable y 2 puntos para el diagnóstico más preciso. Finalmente, enumerarán hasta tres próximos pasos para más evaluación del paciente, con 1 punto otorgado por una respuesta parcialmente correcta y 2 puntos para una respuesta completamente correcta. El resultado primario se analizará a nivel de caso, comparando el rendimiento entre los grupos de estudio aleatorios.
A través de la finalización del estudio, un promedio de 6 meses

Medidas de resultado secundarias

Medida de resultado
Medida Descripción
Periodo de tiempo
Tiempo dedicado por caso
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
Los investigadores compararán el tiempo promedio (en minutos) que los participantes gastan en cada caso en los dos brazos de estudio.
A través de la finalización del estudio, un promedio de 6 meses
Frecuencia rápida
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
Los investigadores compararán la frecuencia de las indicaciones participantes con el modelo GPT-4 personalizado entre los dos grupos de estudio.
A través de la finalización del estudio, un promedio de 6 meses
Sentimiento
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
Los investigadores compararán el tono y el sentimiento de las indicaciones participantes con el modelo GPT-4 personalizado en los dos grupos de estudio. Los investigadores crearán un sistema de codificación cualitativa para clasificar la naturaleza de las indicaciones de los participantes.
A través de la finalización del estudio, un promedio de 6 meses
Percepciones participantes de IA en el razonamiento clínico
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
Este resultado se evaluaría en ambos brazos de estudio y abarcaría los cambios en las actitudes, la confianza y la voluntad de usar herramientas de diagnóstico de IA antes y después de ser expuesta a la herramienta personalizada. Evaluaremos el número de participantes que estuvieron abiertos al uso de AI para ayudar con un razonamiento clínico complejo (antes y después del cuenco), si disfrutaban trabajar con la herramienta de diagnóstico de IA, si sentí que la herramienta proporcionaba una valiosa experiencia colaborativa para el razonamiento clínico, si ver las recomendaciones de Diagnóstico de AI aumentaba su confianza en su estudio de confianza. Estos serán evaluados en una clasificación de la escala Likert desde muy en desacuerdo hasta que estén totalmente de acuerdo.
A través de la finalización del estudio, un promedio de 6 meses
Razonamiento de diagnóstico personalizado de GPT-4
Periodo de tiempo: A través de la finalización del estudio, un promedio de 6 meses
Los diagnósticos "independientes" personalizados de GPT-4 se evaluarán por precisión. El resultado será el porcentaje de respuestas correctas por caso (rango: 0 a 100). Para cada caso, el Meta-PrompT dirige el GPT-4 personalizado para proporcionar sus tres diagnósticos diferenciales principales, junto con hallazgos de apoyo y oposición para cada uno, un diagnóstico final y los próximos pasos. El GPT-4 personalizado recibirá 1 punto para cada diagnóstico plausible. Los hallazgos de apoyo y opuesto se calificarán en función de la corrección, con 1 punto para una respuesta parcialmente correcta y 2 puntos para una respuesta completamente correcta. Su diagnóstico superior ganará 1 punto para una opción razonable y 2 puntos para el diagnóstico más preciso. Finalmente, enumerará hasta tres próximos pasos para más evaluación del paciente, con 1 punto otorgado por una respuesta parcialmente correcta y 2 puntos para una respuesta completamente correcta. El resultado se analizará a nivel de caso, comparando el rendimiento con las puntuaciones de los grupos de estudio aleatorizados.
A través de la finalización del estudio, un promedio de 6 meses

Colaboradores e Investigadores

Aquí es donde encontrará personas y organizaciones involucradas en este estudio.

Patrocinador

Investigadores

  • Investigador principal: Jonathan H Chen, MD, PhD, Stanford University

Fechas de registro del estudio

Estas fechas rastrean el progreso del registro del estudio y los envíos de resultados resumidos a ClinicalTrials.gov. Los registros del estudio y los resultados informados son revisados ​​por la Biblioteca Nacional de Medicina (NLM) para asegurarse de que cumplan con los estándares de control de calidad específicos antes de publicarlos en el sitio web público.

Fechas importantes del estudio

Inicio del estudio (Actual)

16 de diciembre de 2024

Finalización primaria (Actual)

24 de enero de 2025

Finalización del estudio (Actual)

24 de enero de 2025

Fechas de registro del estudio

Enviado por primera vez

11 de febrero de 2025

Primero enviado que cumplió con los criterios de control de calidad

27 de marzo de 2025

Publicado por primera vez (Actual)

4 de abril de 2025

Actualizaciones de registros de estudio

Última actualización publicada (Actual)

4 de abril de 2025

Última actualización enviada que cumplió con los criterios de control de calidad

27 de marzo de 2025

Última verificación

1 de marzo de 2025

Más información

Términos relacionados con este estudio

Términos MeSH relevantes adicionales

Otros números de identificación del estudio

  • 71319c

Plan de datos de participantes individuales (IPD)

¿Planea compartir datos de participantes individuales (IPD)?

NO

Información sobre medicamentos y dispositivos, documentos del estudio

Estudia un producto farmacéutico regulado por la FDA de EE. UU.

No

Estudia un producto de dispositivo regulado por la FDA de EE. UU.

No

producto fabricado y exportado desde los EE. UU.

No

Esta información se obtuvo directamente del sitio web clinicaltrials.gov sin cambios. Si tiene alguna solicitud para cambiar, eliminar o actualizar los detalles de su estudio, comuníquese con register@clinicaltrials.gov. Tan pronto como se implemente un cambio en clinicaltrials.gov, también se actualizará automáticamente en nuestro sitio web. .

Suscribir