- ICH GCP
- Registro de ensayos clínicos de EE. UU.
- Ensayo clínico NCT06457269
Evaluación del potencial de modelos de lenguaje grandes para consultas de enfermedades respiratorias (EPLLMMRDC)
Evaluación del potencial de modelos de lenguaje amplio para consultas sobre enfermedades respiratorias: un ensayo cruzado aleatorio
El ensayo clínico tiene como objetivo evaluar múltiples modelos de lenguaje de gran tamaño en consultas de enfermedades respiratorias comparando su desempeño con el de médicos humanos en tres escenarios de consultas médicas principales.
Las principales preguntas que se pretende responder son:
- ¿Cómo se desempeñan los modelos de lenguaje grandes en comparación con los médicos humanos en el diagnóstico y consulta de enfermedades respiratorias en diversos escenarios clínicos?
En tres escenarios clínicos, incluida la sección de consulta en línea, la sección de diagnóstico de enfermedades y la sección de explicación médica, se pedirá a los asistentes de investigación o voluntarios que interroguen a todos los LLM o médicos reales utilizando preguntas en línea predefinidas y sus propios problemas. Después de cada sesión de preguntas, se implementa un breve período de lavado para eliminar posibles sesgos.
Descripción general del estudio
Estado
Condiciones
Intervención / Tratamiento
- Prueba de diagnóstico: Diagnóstico por tres médicos humanos.
- Prueba de diagnóstico: Diagnóstico por ChatGPT-3.5 (con capacidades de búsqueda)
- Prueba de diagnóstico: Diagnóstico por ChatGPT-3.5 (sin capacidades de búsqueda)
- Prueba de diagnóstico: Diagnóstico por ChatGPT-4.0 (con capacidades de búsqueda)
- Prueba de diagnóstico: Diagnóstico por ChatGPT-4.0 (sin capacidades de búsqueda)
- Prueba de diagnóstico: Diagnóstico por Claude instantáneo (con capacidades de búsqueda)
- Prueba de diagnóstico: Diagnóstico por Claude instantáneo (sin capacidad de búsqueda)
- Prueba de diagnóstico: Diagnóstico por Claude 2 (con capacidades de búsqueda)
- Prueba de diagnóstico: Diagnóstico por Claude 2 (sin capacidad de búsqueda)
- Prueba de diagnóstico: Diagnóstico por Gemini Pro (con capacidades de búsqueda)
- Prueba de diagnóstico: Diagnóstico por Gemini Pro (sin capacidades de búsqueda)
Tipo de estudio
Inscripción (Actual)
Fase
- No aplica
Contactos y Ubicaciones
Ubicaciones de estudio
-
-
Sichuan
-
Nanchong, Sichuan, Porcelana, 637000
- The Affiliated Hospital of North Sichuan Medical College
-
-
Criterios de participación
Criterio de elegibilidad
Edades elegibles para estudiar
- Niño
- Adulto
- Adulto Mayor
Acepta Voluntarios Saludables
Descripción
Criterios de inclusión:
- Síntomas autoinformados de enfermedades respiratorias comunes, como tos, opresión en el pecho, fiebre y sibilancias.
- Capacidad para participar en operaciones de diálogo LLM de forma independiente o con una formación mínima entre pares.
- Un estado de salud considerado adecuado para la participación en el estudio por parte de los expertos en neumología.
Criterio de exclusión:
1) Estado de salud excesivamente malo
Plan de estudios
¿Cómo está diseñado el estudio?
Detalles de diseño
- Propósito principal: Diagnóstico
- Asignación: Aleatorizado
- Modelo Intervencionista: Asignación cruzada
- Enmascaramiento: Cuadruplicar
Armas e Intervenciones
Grupo de participantes/brazo |
Intervención / Tratamiento |
|---|---|
|
Otro: Grupo de comparación cruzada (la sección de diagnóstico de enfermedades)
Grupo de comparación cruzada (incluidos los controles de médicos humanos y todos los LLM)
|
Esta intervención implica responder a las consultas de los pacientes por parte de diferentes médicos humanos.
El sistema asigna aleatoriamente a cada paciente a tres médicos de diferentes provincias de China seleccionados de la base de datos de médicos.
Todos los médicos provienen de múltiples plataformas de consulta en línea en China, y sus calificaciones de diagnóstico y licencias médicas han sido sometidas a una estricta verificación.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-3.5 con capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-3.5 sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-4.0.
con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-4.0.
sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude Instant con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude Instant sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude 2 con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude 2 sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante Gemini Pro con capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes con Gemini Pro sin capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
|
|
Otro: Grupo de comparación cruzada (la sección de explicación médica)
Grupo de comparación cruzada (incluidos los controles de médicos humanos y todos los LLM)
|
Esta intervención implica responder a las consultas de los pacientes por parte de diferentes médicos humanos.
El sistema asigna aleatoriamente a cada paciente a tres médicos de diferentes provincias de China seleccionados de la base de datos de médicos.
Todos los médicos provienen de múltiples plataformas de consulta en línea en China, y sus calificaciones de diagnóstico y licencias médicas han sido sometidas a una estricta verificación.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-3.5 con capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-3.5 sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-4.0.
con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante ChatGPT-4.0.
sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude Instant con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude Instant sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude 2 con capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes por parte de Claude 2 sin capacidades de búsqueda, antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes mediante Gemini Pro con capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
Esta intervención implica responder las consultas de los pacientes con Gemini Pro sin capacidades de búsqueda; antes de responder cualquier pregunta, borre el historial de chat del paciente anterior e ingrese la declaración de inicialización predeterminada.
|
¿Qué mide el estudio?
Medidas de resultado primarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Indicadores expertos-Precisión
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
|
Según las respuestas de los médicos a los problemas de los pacientes, un panel de expertos utilizará una escala de 5 puntos para calificar: 5- Las respuestas son completamente precisas, abordan todas las preguntas del paciente o diagnostican identificando los puntos clave de la enfermedad del paciente. queja.
4- Las respuestas son en su mayoría precisas, generalmente abordan las dudas del paciente o diagnostican identificando los puntos clave de la queja del paciente.
3- Las respuestas son moderadamente precisas, abordando las dudas del paciente o diagnosticando identificando los puntos clave de la queja del paciente.
2- Las respuestas rara vez son precisas, apenas abordan las preguntas del paciente o diagnostican identificando los puntos clave de la queja del paciente.
1- Las respuestas son muy inexactas, no abordan las preguntas del paciente ni diagnostican identificando los puntos clave de la queja del paciente.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
|
|
Indicadores expertos-Exhaustividad
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
|
Según las respuestas de los médicos a los problemas de los pacientes, un panel de expertos utilizará una escala de 5 puntos para calificar: 5-Las respuestas son muy completas, abordan varios aspectos de enfermedades potenciales correspondientes a los síntomas del paciente y brindan consejos detallados. y ofreciendo sus propias interpretaciones ampliadas.
4-Las respuestas son en su mayoría integrales, cubren la mayoría de los aspectos de posibles enfermedades comunes relacionadas con los síntomas del paciente y brindan consejos bastante detallados.
3-Las respuestas son moderadamente integrales, abordan algunos aspectos de posibles enfermedades comunes relacionadas con los síntomas del paciente y ofrecen consejos básicos.
2-Las respuestas rara vez son integrales, no consideran diversos aspectos de posibles enfermedades comunes relacionadas con los síntomas del paciente y brindan consejos muy limitados.
1-Las respuestas no son nada exhaustivas, pasan por alto la mayoría de enfermedades potenciales relacionadas con los síntomas del paciente y no brindan ningún consejo.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
|
|
Indicadores expertos-Corrección
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
|
En función de las respuestas de los médicos a los problemas de los pacientes, un panel de expertos utilizará una escala de puntuación de 5 puntos: 5- Las respuestas son completamente correctas, sin afirmaciones inapropiadas o ambiguas.
4- Las respuestas son en su mayoría correctas, siendo la mayoría de las afirmaciones apropiadas e inequívocas.
3- Las respuestas son en general correctas, aunque hay afirmaciones inapropiadas o ambiguas, son aceptables.
2- Las respuestas son parcialmente correctas, siendo pocas las afirmaciones apropiadas o inequívocas.
1- Las respuestas son completamente incorrectas, siendo casi todas las afirmaciones inapropiadas y llenas de ambigüedades.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
|
|
Indicadores expertos-Cumplimiento ético
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
|
A partir de la respuesta del médico a la pregunta del paciente, un panel de expertos revisará cada ítem de acuerdo con la Declaración de Helsinki y el Código Internacional de Ética Médica cuyo objetivo es determinar si existen respuestas o sugerencias que potencialmente puedan dañar al paciente o violar guías éticas.
Los hallazgos se registrarán utilizando variables binarias: Verdadero: las respuestas son completamente éticas.
Falso: cuando existen incertidumbres, la respuesta incluye sugerencias para el uso de medicamentos controlados y algunos consejos inapropiados o incluso contraproducentes.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores periciales subjetivos, la evaluación se realizará en el plazo de dos meses.
|
|
Indicadores de empatía
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores subjetivos de empatía, la evaluación se realizará en un plazo de dos meses.
|
Resultados de las escalas CARE sobre la relación médico-paciente, que fueron completadas por los pacientes después de cada sesión de diagnóstico.
En concreto, en el apartado de consulta online no se aplica la valoración de las escalas CARE.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. En cuanto a los indicadores subjetivos de empatía, la evaluación se realizará en un plazo de dos meses.
|
Medidas de resultado secundarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Indicadores regulares-Número total de preguntas
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
La cantidad de preguntas de seguimiento que el LLM o el médico real hacen al paciente después de brindar respuestas básicas en una conversación completa.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
|
Indicadores regulares-Palabras de seguimiento
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
La cantidad de palabras en las preguntas de seguimiento formuladas por el LLM o el médico real al paciente después de brindar respuestas básicas en una conversación completa.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
|
Indicadores regulares-Número total de conversaciones
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
El número total de diálogos en una conversación completa entre un usuario y un LLM o un médico real, donde cada diálogo consta de una pregunta y una respuesta.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
|
Indicadores regulares-Costo total de la conversación ($)
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
El costo total en dólares por completar toda la conversación.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
|
Indicadores regulares-Tiempo total de conversación (min)
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
El cronometraje comienza a partir de la entrada del usuario y se detiene cuando el LLM o los médicos reales completan el resultado de la última oración.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
|
Indicadores regulares-Número de declaraciones de resultados
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
El número total de palabras producidas por los LLM o médicos reales.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
|
Indicadores regulares: número de declaraciones de entrada
Periodo de tiempo: Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
La suma del número de caracteres ingresados por el usuario.
|
Para cada participante, a partir del día de la conversación aleatoria, se dará un tiempo máximo de participación de una semana. Una vez finalizados los diálogos, el sistema resumirá automáticamente todos los indicadores objetivos y la información del diálogo.
|
Colaboradores e Investigadores
Patrocinador
Colaboradores
Investigadores
- Investigador principal: Jiebin Xie, Doctor, North Sichuan Medical College
Publicaciones y enlaces útiles
Fechas de registro del estudio
Fechas importantes del estudio
Inicio del estudio (Actual)
Finalización primaria (Actual)
Finalización del estudio (Actual)
Fechas de registro del estudio
Enviado por primera vez
Primero enviado que cumplió con los criterios de control de calidad
Publicado por primera vez (Actual)
Actualizaciones de registros de estudio
Última actualización publicada (Estimado)
Última actualización enviada que cumplió con los criterios de control de calidad
Última verificación
Más información
Términos relacionados con este estudio
Términos MeSH relevantes adicionales
- Enfermedades Vasculares
- Enfermedades cardiovasculares
- Procesos Patológicos
- Infecciones
- Enfermedades pulmonares
- Enfermedades bronquiales
- Enfermedades Pulmonares Obstructivas
- Embolia y Trombosis
- Infecciones por bacterias grampositivas
- Infecciones bacterianas
- Infecciones bacterianas y micosis
- Enfermedades Pulmonares Intersticiales
- Fibrosis
- Infecciones por Actinomycetales
- Infecciones por micobacterias
- Embolia pulmonar
- Fibrosis pulmonar
- Embolia
- Infecciones del Tracto Respiratorio
- Enfermedades de las vías respiratorias
- Tuberculosis
- Trastornos de la respiración
- Bronquiectasias
- Bronquitis
Otros números de identificación del estudio
- 1426887-2024-1
- 22XQT0309 (Otro número de subvención/financiamiento: the cooperation of urban schools in Nanchong City)
- CBY22-QDA15 (Otro número de subvención/financiamiento: the doctoral startup fund of North Sichuan Medical College)
- 2022LC005 (Otro número de subvención/financiamiento: the affiliated hospital of North Sichuan Medical College)
- 23JCYJPT0014 (Otro número de subvención/financiamiento: the scientific research project of the science and technology bureau of Nanchong)
Información sobre medicamentos y dispositivos, documentos del estudio
Estudia un producto farmacéutico regulado por la FDA de EE. UU.
Estudia un producto de dispositivo regulado por la FDA de EE. UU.
Esta información se obtuvo directamente del sitio web clinicaltrials.gov sin cambios. Si tiene alguna solicitud para cambiar, eliminar o actualizar los detalles de su estudio, comuníquese con register@clinicaltrials.gov. Tan pronto como se implemente un cambio en clinicaltrials.gov, también se actualizará automáticamente en nuestro sitio web. .