- ICH GCP
- Registro de ensayos clínicos de EE. UU.
- Ensayo clínico NCT07352475
Enriquecimiento del Razonamiento con Retroalimentación de IA en el Ensayo de Nefrología (REFINe)
Mejora del Razonamiento con Retroalimentación de una IA Generativa en Nefrología (REFINe): Una Evaluación Aleatorizada del Apoyo de la IA Generativa en el Diagnóstico Nefrológico
El objetivo de este ensayo clínico es aprender cómo la inteligencia artificial (IA) puede ayudar a los médicos a realizar diagnósticos en nefrología. Los investigadores quieren saber si una herramienta de IA llamada modelo de lenguaje grande (LLM) puede ayudar a los médicos a elegir el diagnóstico correcto con mayor frecuencia y sentirse más seguros en sus respuestas.
Antes de comenzar el estudio, el equipo de investigación probó varios modelos de IA y eligió uno de los mejores, un modelo de clase GPT-5 configurado para utilizar un alto esfuerzo de razonamiento.
Las principales preguntas que este estudio pretende responder son:
- ¿Los médicos realizan más diagnósticos correctos cuando pueden ver las sugerencias de IA?
- ¿Ver las sugerencias de IA cambia cómo de seguros se sienten los médicos sobre su diagnóstico?
Los investigadores compararán a los médicos que reciben sugerencias de IA con los médicos que no las reciben para ver cómo afecta la IA a la precisión, la confianza y la toma de decisiones.
Los participantes completarán hasta 10 casos clínicos en línea. Para cada caso, deberán:
- Leer un breve escenario médico
- Sugerir hasta tres diagnósticos posibles
(Si están en el grupo de IA) Revisar las sugerencias de la IA y decidir si cambiar su respuesta
El estudio también examinará cuánto tiempo tardan los participantes en responder cada caso y cómo se compara el rendimiento de la IA con las respuestas humanas.
Descripción general del estudio
Estado
Condiciones
Intervención / Tratamiento
Descripción detallada
Este estudio evalúa si proporcionar a los clínicos sugerencias diagnósticas en tiempo real de un modelo de lenguaje grande de alto razonamiento (GPT-5) mejora la precisión diagnóstica, la confianza y la eficiencia al resolver viñetas clínicas de nefrología. Antes de seleccionar el modelo para el ensayo, el equipo de investigación evaluó varios modelos de última generación en un conjunto piloto de casos de nefrología, incluyendo: GPT-5, GPT-5-mini, O3, GPT-4o, Llama-4 Maverick-17B, Gemini-2.5-Pro, Qwen-3 VL-235B Thinking, DeepSeek-V3.2-Exp, MedGEMMA-27B, Claude Sonnet-4.5 y Magistral-Medium-2509. GPT-5 (alto razonamiento) demostró el mayor rendimiento diagnóstico, estabilidad e interpretabilidad, y fue seleccionado como el sistema de IA utilizado en el brazo de intervención.
Los participantes incluyen estudiantes de medicina, residentes, becarios y médicos en ejercicio. Después de crear una cuenta, los participantes completan un cuestionario demográfico (especialidad, años de experiencia, tipo de práctica, categoría de edad, familiaridad con IA) y deben aceptar explícitamente el uso de estos datos con fines de investigación antes de acceder a las viñetas. No se recopila información directamente identificativa.
Los participantes son aleatorizados (con estratificación por estatus profesional) al brazo asistido por IA o al brazo de control. A cada participante se le asignan 10 viñetas de nefrología en francés o inglés y puede completarlas en múltiples sesiones. Una vez que se envía una viñeta, no se puede volver a consultar ("sin retroceso"). El tiempo de finalización por viñeta se registra automáticamente.
Brazo de Control
Los participantes ven cada viñeta y proporcionan hasta tres diagnósticos ("Top-3"), seguidos de una calificación de confianza (0-10).
Brazo Asistido por IA
Los participantes primero ingresan un diagnóstico inicial Top-3 y una calificación de confianza sin asistencia de IA. El sistema luego muestra las sugerencias diagnósticas de GPT-5, después de lo cual los participantes pueden revisar sus diagnósticos una vez. La viñeta se bloquea después del envío.
El estudio recopila:
- diagnósticos iniciales y finales,
- calificaciones de confianza antes y (si corresponde) después de las sugerencias de IA,
- tiempos de finalización,
- variables demográficas de los participantes,
- y las salidas diagnósticas propias del modelo de IA.
Se permite la finalización parcial; todas las viñetas completadas contribuyen al análisis.
Los resultados primarios y secundarios incluyen precisión diagnóstica (Top-3 y Top-1), mejora de precisión antes vs. después de IA, cambios en la confianza diagnóstica, errores diagnósticos inducidos por IA, evaluación comparativa humano vs. IA, métricas de eficiencia de tiempo de finalización y la proporción de viñetas asignadas completadas.
El análisis primario comparará la precisión diagnóstica entre el brazo de control (médicos solos) y el brazo experimental (médicos asistidos por el modelo de IA). La precisión se analiza como un resultado binario (diagnóstico correcto vs incorrecto). Dado que cada participante evalúa múltiples viñetas clínicas, la precisión se modelará utilizando una regresión logística de efectos mixtos con un efecto fijo para el brazo del estudio e interceptos aleatorios tanto para el participante como para la viñeta. Este enfoque tiene en cuenta la agrupación y la dificultad variable entre casos. La prueba de hipótesis primaria utiliza un α = 0.05 bilateral. Los tamaños del efecto se informarán como odds ratios con intervalos de confianza del 95%. Los análisis secundarios explorarán si la precisión varía según factores demográficos (por ejemplo, nivel de experiencia, especialidad) utilizando términos de interacción.
Dado que cada participante evalúa múltiples viñetas, el equipo también realizó análisis de potencia basados en simulación utilizando modelos de regresión logística de efectos mixtos con interceptos aleatorios tanto para el participante como para la viñeta, asumiendo un ICC intra-participante de 0.10. Bajo estos supuestos, una muestra total de 100 participantes (50 por brazo) con 10 viñetas por participante proporciona >99% de potencia para detectar una mejora clínicamente significativa en la precisión diagnóstica. Por lo tanto, los investigadores planean reclutar aproximadamente 100 participantes en total.
Este estudio tiene como objetivo cuantificar si el razonamiento aumentado por IA mejora significativamente el rendimiento diagnóstico y la toma de decisiones cuando los clínicos evalúan casos complejos de nefrología.
Tipo de estudio
Inscripción (Estimado)
Fase
- No aplica
Contactos y Ubicaciones
Estudio Contacto
- Nombre: Raphaël BENTEGEAC, MD, MPH
- Número de teléfono: +33651204000
- Correo electrónico: raphael.bentegeac@univ-lille.fr
Ubicaciones de estudio
-
-
-
Lille, Francia, 59000
- Reclutamiento
- Lille University Hospital (online study)
-
Contacto:
- Raphaël BENTEGEAC, MD, MPH
- Número de teléfono: +33651204000
- Correo electrónico: raphael.bentegeac@chu-lille.fr
-
Contacto:
- Aghiles HAMROUN, MD, PhD
- Correo electrónico: aghiles.hamroun@univ-lille.fr
-
-
Criterios de participación
Criterio de elegibilidad
Edades elegibles para estudiar
- Adulto
- Adulto Mayor
Acepta Voluntarios Saludables
Descripción
Criterios de inclusión:
Adultos de 18 años o más.
Capacidad para leer y responder viñetas clínicas en inglés o francés.
Acceso a un ordenador o teléfono inteligente con conexión a Internet.
Proporciona consentimiento informado en línea.
Se espera que los participantes tengan al menos formación médica básica (por ejemplo, estudiantes de medicina, residentes, becarios o clínicos en ejercicio), aunque no se requiere verificación formal.
Criterios de exclusión:
Personas menores de 18 años.
Incapacidad para completar los procedimientos del estudio en línea.
Participación previa en el diseño, desarrollo o evaluación del sistema de IA utilizado en este estudio.
Plan de estudios
¿Cómo está diseñado el estudio?
Detalles de diseño
- Propósito principal: Diagnóstico
- Asignación: Aleatorizado
- Modelo Intervencionista: Asignación paralela
- Enmascaramiento: Ninguno (etiqueta abierta)
Armas e Intervenciones
Grupo de participantes/brazo |
Intervención / Tratamiento |
|---|---|
|
Experimental: Grupo con sugerencias de IA
Los participantes en este brazo completarán las mismas viñetas de casos clínicos que el grupo de control.
Para cada caso, recibirán un diagnóstico sugerido generado por un modelo de lenguaje grande (GPT-5, configuración de alto razonamiento), que fue seleccionado tras una evaluación comparativa interna.
Los participantes pueden revisar la sugerencia de IA antes de introducir su propia respuesta diagnóstica final.
No se proporciona información adicional, indicaciones ni orientación.
La intervención consiste únicamente en mostrar la sugerencia diagnóstica generada por la IA durante la tarea de resolución de casos.
|
Esta intervención consiste en mostrar una sugerencia diagnóstica generada por IA durante la tarea de resolución de casos clínicos.
Después de leer cada viñeta, los participantes ven la principal propuesta diagnóstica producida por un modelo de lenguaje grande (GPT-5, configuración de alto razonamiento), seleccionada tras una evaluación interna comparativa.
La sugerencia de IA aparece una vez por viñeta y no puede solicitarse de nuevo ni modificarse.
Los participantes pueden revisar su respuesta diagnóstica después de ver la sugerencia, pero no pueden volver a la viñeta más tarde.
No se proporciona orientación adicional, asesoramiento ni funciones interactivas.
|
|
Sin intervención: Grupo sin sugerencias de IA
Los participantes en este brazo completarán las viñetas de casos clínicos de forma independiente, sin ninguna sugerencia diagnóstica generada por IA.
Leerán cada viñeta y proporcionarán su propia respuesta diagnóstica basándose únicamente en la información presentada.
No se proporciona apoyo externo para la toma de decisiones ni materiales adicionales.
|
¿Qué mide el estudio?
Medidas de resultado primarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Precisión diagnóstica final (top-3) con vs sin apoyo de IA
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Para cada participante, proporción de viñetas en las que el diagnóstico principal correcto está incluido entre los 3 diagnósticos principales finales del participante. Comparar la precisión de los 3 diagnósticos principales finales entre el brazo de IA (tras sugerencias de IA) y el brazo de control (sin IA). Porcentaje de casos diagnosticados correctamente (3 principales). |
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Medidas de resultado secundarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Precisión diagnóstica final (top-1) con vs sin soporte de IA
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Para cada participante, proporción de viñetas donde el diagnóstico principal correcto está incluido en los diagnósticos finales top-1 del participante.
Comparar la precisión final top-1 entre el brazo de IA (después de las sugerencias de IA) y el brazo de control (sin IA).
Porcentaje de casos diagnosticados correctamente (top-1).
|
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
|
Cambio en la precisión diagnóstica de los 3 principales diagnósticos antes vs después de las sugerencias de IA (solo brazo de IA)
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
En el grupo asistido por IA, los participantes primero proporcionan una respuesta inicial (hasta tres diagnósticos) sin sugerencias de IA, luego ven sugerencias generadas por IA y pueden revisar su respuesta una vez; no pueden volver a esa viñeta más tarde. Para cada participante, los investigadores calculan la diferencia en la precisión de los 3 mejores diagnósticos entre las respuestas iniciales y finales en todas las viñetas completadas. Cambio en puntos porcentuales en la precisión diagnóstica de los 3 mejores diagnósticos |
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
|
Cambio en la precisión diagnóstica top-1 antes frente a después de las sugerencias de IA (solo brazo de IA)
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
En el brazo con apoyo de IA, los participantes primero proporcionan una respuesta inicial (hasta tres diagnósticos) sin sugerencias de IA, luego ven sugerencias generadas por IA y pueden revisar su respuesta una vez; no pueden volver a esa viñeta más tarde. Para cada participante, los investigadores calculan la diferencia en la precisión del primer lugar entre las respuestas iniciales y finales en todas las viñetas completadas. Cambio en puntos porcentuales en la precisión diagnóstica del primer lugar |
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
|
Confianza diagnóstica (0-10) antes de las sugerencias de IA: Grupo de control vs grupo de IA
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Los participantes en ambos brazos califican su confianza (escala de 0 a 10) en su propuesta diagnóstica Top-3 antes de cualquier sugerencia de IA. En el brazo de IA, esta es la calificación "pre-IA". En el brazo de Control, esta es la única calificación de confianza (ya que no se muestra IA). Los investigadores comparan la confianza pre-IA entre los brazos, agregada en todas las viñetas completadas por participante. |
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
|
Confianza diagnóstica final (0-10) tras las sugerencias de IA: Grupo control frente a grupo con IA
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Confianza diagnóstica final (escala 0-10) en la propuesta diagnóstica entre los 3 primeros diagnósticos en todas las viñetas completadas, comparada entre los grupos. En el grupo de IA, esta es la valoración de confianza posterior a la IA. En el grupo de control, esta es la misma valoración de confianza (los participantes no reciben sugerencias de IA). |
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
|
Cambio en la confianza diagnóstica (0-10) antes vs después de las sugerencias de IA (solo brazo de IA)
Periodo de tiempo: Desde el primer viñeta respondida hasta el final del estudio (hasta 12 meses).
|
En el brazo de IA, los participantes proporcionan calificaciones de confianza (escala 0-10) para sus 3 diagnósticos principales tanto antes como después de ver las sugerencias de IA. Para cada participante, los investigadores calculan el cambio intra-participante (post-IA menos pre-IA) en todos los viñetas completadas. Cambio en la puntuación de confianza (escala 0-10) |
Desde el primer viñeta respondida hasta el final del estudio (hasta 12 meses).
|
|
Error de diagnóstico inducido por IA (solo brazo de IA)
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Entre las viñetas completadas en las que el diagnóstico inicial Top-1 del participante es correcto, proporción para la cual el diagnóstico final Top-1 se vuelve incorrecto después de las sugerencias de IA.
|
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
|
Cambio en las 3 principales diagnósticos tras las sugerencias de la IA (solo el grupo de la IA)
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Entre las viñetas completadas en el brazo de IA, la proporción en la que el diagnóstico entre los 3 principales difiere entre las respuestas previas a la IA y posteriores a la IA.
|
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
|
Precisión diagnóstica de las 3 mejores: Todas las respuestas humanas antes de la IA vs precisión de la IA
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Para cada viñeta, la precisión diagnóstica Top-3 de los participantes humanos antes de cualquier sugerencia de IA (combinando participantes de ambos brazos del estudio en su etapa previa a la IA) se compara con la precisión diagnóstica Top-3 del modelo de IA para la misma viñeta. El Resultado reportado es la diferencia de precisión, definida como la precisión Top-3 de la IA menos la precisión Top-3 humana previa a la IA, expresada en puntos porcentuales y calculada a nivel de viñeta en todas las viñetas completadas. Diferencia en puntos porcentuales en la precisión diagnóstica Top-3 |
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
|
Precisión diagnóstica Top-3: Respuestas finales humanas tras IA vs precisión de la IA (solo brazo de IA)
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Por cada viñeta completada en el brazo con apoyo de IA, se compara la precisión diagnóstica Top-3 de los participantes humanos después de ver las sugerencias de IA con la precisión diagnóstica Top-3 del modelo de IA. (La precisión Top-3 es una medida única) El resultado reportado es la diferencia de precisión, definida como la precisión Top-3 de la IA menos la precisión Top-3 humana post-IA, expresada en puntos porcentuales y calculada a nivel de viñeta en todas las viñetas completadas en el brazo de IA. Diferencia en puntos porcentuales en la precisión diagnóstica Top-3 entre la IA y los humanos |
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
|
Tiempo de finalización por viñeta con y sin soporte de IA
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Para cada viñeta, la plataforma registra el tiempo desde la apertura de la viñeta hasta el envío de la respuesta. En el brazo de control, se registra un único tiempo de finalización para cada viñeta. En el brazo con soporte de IA, el tiempo de finalización se registra antes de ver las sugerencias de IA y nuevamente después de ver las sugerencias de IA. El resultado informa la diferencia en el tiempo de finalización entre los brazos del estudio, expresada en segundos y calculada en todas las viñetas completadas. Segundos (diferencia en el tiempo de finalización) |
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
|
Proporción de viñetas asignadas completadas
Periodo de tiempo: Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Para cada participante, la proporción de las 10 viñetas completadas dentro del período de estudio, comparada entre los grupos.
|
Desde la primera viñeta respondida hasta el final del estudio (hasta 12 meses).
|
Colaboradores e Investigadores
Patrocinador
Fechas de registro del estudio
Fechas importantes del estudio
Inicio del estudio (Actual)
Finalización primaria (Estimado)
Finalización del estudio (Estimado)
Fechas de registro del estudio
Enviado por primera vez
Primero enviado que cumplió con los criterios de control de calidad
Publicado por primera vez (Actual)
Actualizaciones de registros de estudio
Última actualización publicada (Actual)
Última actualización enviada que cumplió con los criterios de control de calidad
Última verificación
Más información
Términos relacionados con este estudio
Palabras clave
Términos MeSH relevantes adicionales
Otros números de identificación del estudio
- CHUL-191125
Información sobre medicamentos y dispositivos, documentos del estudio
Estudia un producto farmacéutico regulado por la FDA de EE. UU.
Estudia un producto de dispositivo regulado por la FDA de EE. UU.
Esta información se obtuvo directamente del sitio web clinicaltrials.gov sin cambios. Si tiene alguna solicitud para cambiar, eliminar o actualizar los detalles de su estudio, comuníquese con register@clinicaltrials.gov. Tan pronto como se implemente un cambio en clinicaltrials.gov, también se actualizará automáticamente en nuestro sitio web. .