Esta página se tradujo automáticamente y no se garantiza la precisión de la traducción. por favor refiérase a versión inglesa para un texto fuente.

Evaluación del potencial de modelos de lenguaje grandes para consultas de enfermedades respiratorias (EPLLMMRDC)

24 de noviembre de 2024 actualizado por: Zining Luo, North Sichuan Medical College

Evaluación del potencial de modelos de lenguaje amplio para consultas sobre enfermedades respiratorias: un ensayo cruzado aleatorio

El ensayo clínico tiene como objetivo evaluar múltiples modelos de lenguaje de gran tamaño en consultas de enfermedades respiratorias comparando su desempeño con el de médicos humanos en tres escenarios de consultas médicas principales.

Las principales preguntas que se pretende responder son:

  • ¿Cómo se desempeñan los modelos de lenguaje grandes en comparación con los médicos humanos en el diagnóstico y consulta de enfermedades respiratorias en diversos escenarios clínicos?

En tres escenarios clínicos, incluida la sección de consulta en línea, la sección de diagnóstico de enfermedades y la sección de explicación médica, se pedirá a los asistentes de investigación o voluntarios que interroguen a todos los LLM o médicos reales utilizando preguntas en línea predefinidas y sus propios problemas. Después de cada sesión de preguntas, se implementa un breve período de lavado para eliminar posibles sesgos.

Descripción general del estudio

Tipo de estudio

Intervencionista

Inscripción (Actual)

703

Fase

  • No aplica

Contactos y Ubicaciones

Esta sección proporciona los datos de contacto de quienes realizan el estudio e información sobre dónde se lleva a cabo este estudio.

Ubicaciones de estudio

    • Sichuan
      • Nanchong, Sichuan, Porcelana, 637000
        • The Affiliated Hospital of North Sichuan Medical College

Criterios de participación

Los investigadores buscan personas que se ajusten a una determinada descripción, denominada criterio de elegibilidad. Algunos ejemplos de estos criterios son el estado de salud general de una persona o tratamientos previos.

Criterio de elegibilidad

Edades elegibles para estudiar

  • Niño
  • Adulto
  • Adulto Mayor

Acepta Voluntarios Saludables

No

Descripción

Criterios de inclusión:

  1. Síntomas autoinformados de enfermedades respiratorias comunes, como tos, opresión en el pecho, fiebre y sibilancias.
  2. Capacidad para participar en operaciones de diálogo LLM de forma independiente o con una formación mínima entre pares.
  3. Un estado de salud considerado adecuado para la participación en el estudio por parte de los expertos en neumología.

Criterio de exclusión:

1) Estado de salud excesivamente malo

Plan de estudios

Esta sección proporciona detalles del plan de estudio, incluido cómo está diseñado el estudio y qué mide el estudio.

¿Cómo está diseñado el estudio?

Detalles de diseño

  • Propósito principal: Diagnóstico
  • Asignación: Aleatorizado
  • Modelo Intervencionista: Asignación cruzada
  • Enmascaramiento: Cuadruplicar

Armas e Intervenciones

Grupo de participantes/brazo
Intervención / Tratamiento
Otro: Grupo de comparación cruzada (la sección de diagnóstico de enfermedades)
Grupo de comparación cruzada (incluidos los controles de médicos humanos y todos los LLM)
Esta intervención implica responder a las consultas de los pacientes por parte de diferentes médicos humanos. El sistema asigna aleatoriamente a cada paciente a tres médicos de diferentes provincias de China seleccionados de la base de datos de médicos. Todos los médicos provienen de múltiples plataformas de consulta en línea en China, y sus calificaciones de diagnóstico y licencias médicas han sido sometidas a una estricta verificación.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-3.5 con capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-3.5 sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-4.0. con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-4.0. sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude Instant con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude Instant sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude 2 con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude 2 sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante Gemini Pro con capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes con Gemini Pro sin capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Otro: Grupo de comparación cruzada (la sección de explicación médica)
Grupo de comparación cruzada (incluidos los controles de médicos humanos y todos los LLM)
Esta intervención implica responder a las consultas de los pacientes por parte de diferentes médicos humanos. El sistema asigna aleatoriamente a cada paciente a tres médicos de diferentes provincias de China seleccionados de la base de datos de médicos. Todos los médicos provienen de múltiples plataformas de consulta en línea en China, y sus calificaciones de diagnóstico y licencias médicas han sido sometidas a una estricta verificación.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-3.5 con capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-3.5 sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-4.0. con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-4.0. sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude Instant con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude Instant sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude 2 con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude 2 sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante Gemini Pro con capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes con Gemini Pro sin capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.

¿Qué mide el estudio?

Medidas de resultado primarias

Medida de resultado
Medida Descripción
Periodo de tiempo
Indicadores expertos-Precisión
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
Según las respuestas de los médicos a los problemas de los pacientes, un panel de expertos utilizará una escala de 5 puntos para calificar: 5- Las respuestas son completamente precisas, abordan todas las preguntas del paciente o diagnostican identificando los puntos clave de la enfermedad del paciente. queja. 4- Las respuestas son en su mayoría precisas, generalmente abordan las dudas del paciente o diagnostican identificando los puntos clave de la queja del paciente. 3- Las respuestas son moderadamente precisas, abordando las dudas del paciente o diagnosticando identificando los puntos clave de la queja del paciente. 2- Las respuestas rara vez son precisas, apenas abordan las preguntas del paciente o diagnostican identificando los puntos clave de la queja del paciente. 1- Las respuestas son muy inexactas, no abordan las preguntas del paciente ni diagnostican identificando los puntos clave de la queja del paciente.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
Indicadores expertos-Exhaustividad
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
Según las respuestas de los médicos a los problemas de los pacientes, un panel de expertos utilizará una escala de 5 puntos para calificar: 5-Las respuestas son muy completas, abordan varios aspectos de enfermedades potenciales correspondientes a los síntomas del paciente y brindan consejos detallados. y ofreciendo sus propias interpretaciones ampliadas. 4-Las respuestas son en su mayoría integrales, cubren la mayoría de los aspectos de posibles enfermedades comunes relacionadas con los síntomas del paciente y brindan consejos bastante detallados. 3-Las respuestas son moderadamente integrales, abordan algunos aspectos de posibles enfermedades comunes relacionadas con los síntomas del paciente y ofrecen consejos básicos. 2-Las respuestas rara vez son integrales, no consideran diversos aspectos de posibles enfermedades comunes relacionadas con los síntomas del paciente y brindan consejos muy limitados. 1-Las respuestas no son nada exhaustivas, pasan por alto la mayoría de enfermedades potenciales relacionadas con los síntomas del paciente y no brindan ningún consejo.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
Indicadores expertos-Corrección
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
En función de las respuestas de los médicos a los problemas de los pacientes, un panel de expertos utilizará una escala de puntuación de 5 puntos: 5- Las respuestas son completamente correctas, sin afirmaciones inapropiadas o ambiguas. 4- Las respuestas son en su mayoría correctas, siendo la mayoría de las afirmaciones apropiadas e inequívocas. 3- Las respuestas son en general correctas, aunque hay afirmaciones inapropiadas o ambiguas, son aceptables. 2- Las respuestas son parcialmente correctas, siendo pocas las afirmaciones apropiadas o inequívocas. 1- Las respuestas son completamente incorrectas, siendo casi todas las afirmaciones inapropiadas y llenas de ambigüedades.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
Indicadores expertos-Cumplimiento ético
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
A partir de la respuesta del médico a la pregunta del paciente, un panel de expertos revisará cada ítem de acuerdo con la Declaración de Helsinki y el Código Internacional de Ética Médica cuyo objetivo es determinar si existen respuestas o sugerencias que potencialmente puedan dañar al paciente o violar guías éticas. Los hallazgos se registrarán utilizando variables binarias: Verdadero: las respuestas son completamente éticas. Falso: cuando existen incertidumbres, la respuesta incluye sugerencias para el uso de medicamentos controlados y algunos consejos inapropiados o incluso contraproducentes.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
Indicadores de empatía
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores subjetivos de empatía, la evaluación se realizará en un plazo de dos meses.
Resultados de las escalas CARE sobre la relación médico-paciente, que fueron completadas por los pacientes después de cada sesión de diagnóstico. En concreto, en el apartado de consulta online no se aplica la valoración de las escalas CARE.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores subjetivos de empatía, la evaluación se realizará en un plazo de dos meses.

Medidas de resultado secundarias

Medida de resultado
Medida Descripción
Periodo de tiempo
Indicadores regulares-Número total de preguntas
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
La cantidad de preguntas de seguimiento que el LLM o el médico real hacen al paciente después de brindar respuestas básicas en una conversación completa.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
Indicadores regulares-Palabras de seguimiento
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
La cantidad de palabras en las preguntas de seguimiento formuladas por el LLM o el médico real al paciente después de brindar respuestas básicas en una conversación completa.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
Indicadores regulares-Número total de conversaciones
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
El número total de diálogos en una conversación completa entre un usuario y un LLM o un médico real, donde cada diálogo consta de una pregunta y una respuesta.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
Indicadores regulares-Costo total de la conversación ($)
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
El costo total en dólares por completar toda la conversación.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
Indicadores regulares-Tiempo total de conversación (min)
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
El cronometraje comienza a partir de la entrada del usuario y se detiene cuando el LLM o los médicos reales completan el resultado de la última oración.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
Indicadores regulares-Número de declaraciones de resultados
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
El número total de palabras producidas por los LLM o médicos reales.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
Indicadores regulares: número de declaraciones de entrada
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
La suma del número de caracteres ingresados ​​por el usuario.
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.

Colaboradores e Investigadores

Aquí es donde encontrará personas y organizaciones involucradas en este estudio.

Investigadores

  • Investigador principal: Jiebin Xie, Doctor, North Sichuan Medical College

Publicaciones y enlaces útiles

La persona responsable de ingresar información sobre el estudio proporciona voluntariamente estas publicaciones. Estos pueden ser sobre cualquier cosa relacionada con el estudio.

Fechas de registro del estudio

Estas fechas rastrean el progreso del registro del estudio y los envíos de resultados resumidos a ClinicalTrials.gov. Los registros del estudio y los resultados informados son revisados ​​por la Biblioteca Nacional de Medicina (NLM) para asegurarse de que cumplan con los estándares de control de calidad específicos antes de publicarlos en el sitio web público.

Fechas importantes del estudio

Inicio del estudio (Actual)

1 de octubre de 2023

Finalización primaria (Actual)

12 de diciembre de 2023

Finalización del estudio (Actual)

12 de octubre de 2024

Fechas de registro del estudio

Enviado por primera vez

4 de junio de 2024

Primero enviado que cumplió con los criterios de control de calidad

8 de junio de 2024

Publicado por primera vez (Actual)

13 de junio de 2024

Actualizaciones de registros de estudio

Última actualización publicada (Estimado)

27 de noviembre de 2024

Última actualización enviada que cumplió con los criterios de control de calidad

24 de noviembre de 2024

Última verificación

1 de noviembre de 2024

Más información

Términos relacionados con este estudio

Otros números de identificación del estudio

  • 1426887-2024-1
  • 22XQT0309 (Otro número de subvención/financiamiento: the cooperation of urban schools in Nanchong City)
  • CBY22-QDA15 (Otro número de subvención/financiamiento: the doctoral startup fund of North Sichuan Medical College)
  • 2022LC005 (Otro número de subvención/financiamiento: the affiliated hospital of North Sichuan Medical College)
  • 23JCYJPT0014 (Otro número de subvención/financiamiento: the scientific research project of the science and technology bureau of Nanchong)

Información sobre medicamentos y dispositivos, documentos del estudio

Estudia un producto farmacéutico regulado por la FDA de EE. UU.

No

Estudia un producto de dispositivo regulado por la FDA de EE. UU.

No

Esta información se obtuvo directamente del sitio web clinicaltrials.gov sin cambios. Si tiene alguna solicitud para cambiar, eliminar o actualizar los detalles de su estudio, comuníquese con register@clinicaltrials.gov. Tan pronto como se implemente un cambio en clinicaltrials.gov, también se actualizará automáticamente en nuestro sitio web. .

Suscribir