- ICH GCP
- Registro de ensayos clínicos de EE. UU.
- Ensayo clínico NCT07328815
Mitigación del Sesgo de Automatización en el Razonamiento Diagnóstico Médico-LLM mediante Incentivos Conductuales
Mitigación del sesgo de automatización en el razonamiento diagnóstico médico-LLM mediante impulsos conductuales
El objetivo de este ensayo controlado aleatorizado es evaluar si los estímulos conductuales pueden reducir el sesgo de automatización, la aceptación acrítica de la salida automatizada, en médicos que utilizan modelos de lenguaje grandes (LLM) como ChatGPT-5.1 para la toma de decisiones clínicas.
La pregunta principal que pretende responder es: ¿Una intervención de estímulo conductual de doble mecanismo (anclaje de precisión basal más señales de confianza codificadas por colores específicas del caso) reduce la aceptación acrítica por parte de los médicos de las recomendaciones incorrectas de los LLM?
Los investigadores compararán a los médicos que reciben recomendaciones de LLM junto con un estímulo conductual con aquellos que reciben recomendaciones de LLM sin el estímulo para evaluar si el estímulo reduce el sesgo de automatización.
Los participantes:
- Evaluarán seis viñetas clínicas acompañadas de recomendaciones generadas por LLM (la mitad conteniendo errores deliberados y clínicamente significativos).
- Grupo de control: Podrán ver las recomendaciones de LLM en formato estándar sin el estímulo.
- Grupo de tratamiento: Podrán ver la precisión diagnóstica de ChatGPT en conjuntos de datos médicos estándar como un anclaje inicial, luego recibirán señales de confianza codificadas por colores junto a cada recomendación (por ejemplo, rojo para baja confianza).
- Sus respuestas serán evaluadas por revisores cegados utilizando una rúbrica de evaluación desarrollada por expertos para detectar la aceptación acrítica de información errónea.
Descripción general del estudio
Estado
Condiciones
Intervención / Tratamiento
Descripción detallada
El sesgo de automatización representa un desafío crítico en la práctica clínica moderna, especialmente a medida que las herramientas de inteligencia artificial (IA) se integran cada vez más en los flujos de trabajo sanitarios. Este fenómeno cognitivo describe la tendencia de los clínicos a favorecer las sugerencias de los sistemas automatizados de toma de decisiones, incluso cuando esas sugerencias son incorrectas. A medida que los Modelos de Lenguaje de Gran Tamaño (LLM) como ChatGPT-5.1 ganan terreno en entornos médicos, su potencial para reducir errores y mejorar la eficiencia debe sopesarse con una preocupación significativa: estos modelos carecen de validación médica rigurosa y pueden amplificar los sesgos cognitivos existentes a través de recomendaciones incorrectas o engañosas.
La aparición del sesgo de automatización en contextos médicos refleja una compleja interacción de factores ambientales y psicológicos. Las limitaciones de tiempo en entornos clínicos de alto volumen generan presión para aceptar recomendaciones generadas por IA sin un escrutinio adecuado. Los incentivos financieros que priorizan la eficiencia sobre la exhaustividad pueden desalentar aún más la evaluación crítica necesaria para un juicio clínico sólido. La fatiga cognitiva durante turnos prolongados disminuye la capacidad de los médicos para un pensamiento analítico sostenido. Estas presiones interactúan con mecanismos psicológicos que incluyen la difusión de responsabilidad, la excesiva confianza en soluciones tecnológicas y la descarga cognitiva, creando colectivamente condiciones en las que la aceptación acrítica de recomendaciones generadas por IA se vuelve más probable.
Este ensayo controlado aleatorizado evalúa la efectividad de una intervención de empuje conductual diseñada para mitigar el sesgo de automatización entre médicos que utilizan recomendaciones diagnósticas generadas por LLM. El objetivo principal es determinar si esta intervención mejora las puntuaciones de rendimiento del razonamiento diagnóstico al evaluar viñetas clínicas que incluyen recomendaciones de LLM deliberadamente defectuosas. Los objetivos secundarios incluyen evaluar si el nivel de experiencia del médico, el género y la experiencia previa con LLM moderan la efectividad de la intervención, y determinar la efectividad diferencial para viñetas con diferentes señales de confianza.
Este estudio emplea un ensayo controlado aleatorizado de simple ciego con dos brazos paralelos. Los participantes serán asignados aleatoriamente 1:1 al brazo de intervención o al de control. Para eliminar la variabilidad por diferencias en habilidades de solicitud, los participantes no interactuarán directamente con una interfaz de LLM en vivo. En su lugar, todos los participantes utilizarán una plataforma web personalizada que muestra viñetas clínicas con recomendaciones de LLM pregeneradas, garantizando contenido generado por LLM idéntico para cada viñeta.
Todos los participantes evaluarán seis viñetas clínicas durante una única sesión supervisada de aproximadamente 75 minutos. Tres viñetas contendrán fallos de razonamiento clínico introducidos deliberadamente en las recomendaciones del LLM, mientras que tres contendrán recomendaciones correctas. Las viñetas se presentarán en orden aleatorio para evitar la detección de patrones.
Los participantes del brazo de control evaluarán viñetas clínicas con recomendaciones diagnósticas de LLM generadas por ChatGPT presentadas en formato de texto estándar y neutro sin información contextual adicional. Los participantes del brazo de intervención evaluarán las mismas viñetas junto con un empuje conductual. Esta intervención consta de dos señales cognitivas sincronizadas: (1) una señal de anclaje que muestra la precisión diagnóstica basal de ChatGPT en conjuntos de datos médicos estándar en la parte superior del panel de interfaz, anclando explícitamente las expectativas a la falibilidad del modelo, y (2) una señal de atención selectiva que muestra la recomendación del LLM junto con una señal de confianza codificada por colores generada mediante una evaluación de conjunto: tres LLM independientes de última generación (Claude Sonnet 4.5, Gemini 2.5 Pro Thinking y GPT-5.1) proporcionan cada uno calificaciones de confianza para la recomendación, y la confianza media determina el color de la señal para mitigar la descalibración de un solo modelo.
Las señales de confianza codificadas por colores se clasifican en tres niveles distintos según la confianza media del conjunto en relación con la precisión diagnóstica basal. Las señales rojas se activan cuando la confianza media cae por debajo de la precisión basal establecida de ChatGPT, marcando explícitamente casos de alta incertidumbre que exigen un escrutinio crítico intensificado. Las señales naranjas indican que, aunque la confianza media supera el promedio basal, permanece por debajo del 100%, señalando la necesidad de vigilancia clínica continua y la evitación de la complacencia. Finalmente, las señales verdes se reservan para instancias de consenso del 100% del conjunto; sin embargo, incluso en este nivel de confianza, las advertencias estándar de seguridad de IA permanecen presentes para protegerse contra la dependencia excesiva de la salida del sistema.
Se presentará a los participantes seis viñetas clínicas diseñadas específicamente para medir el sesgo de automatización, obtenidas y modificadas de casos reales que representan un rango de dificultad diagnóstica y especialidades médicas comunes. Cada viñeta sigue un formato estandarizado que incluye motivo de consulta principal, historia de la enfermedad actual, antecedentes médicos/sociales/familiares relevantes, hallazgos del examen físico y resultados de laboratorio iniciales.
El resultado principal es la Puntuación de Rendimiento del Razonamiento Diagnóstico, una puntuación porcentual compuesta basada en una rúbrica estructurada que evalúa: calidad de diagnósticos diferenciales, hallazgos de apoyo, hallazgos opuestos, precisión del diagnóstico final y adecuación de los siguientes pasos. Los resultados secundarios incluyen la precisión del diagnóstico de primera elección (incorrecto, parcialmente correcto o correcto). Todas las respuestas serán evaluadas por revisores cegados utilizando la rúbrica de evaluación.
Tipo de estudio
Inscripción (Actual)
Fase
- No aplica
Contactos y Ubicaciones
Ubicaciones de estudio
-
-
Punjab Province
-
Lahore, Punjab Province, Pakistán, 54792
- Lahore University of Management Sciences
-
-
Criterios de participación
Criterio de elegibilidad
Edades elegibles para estudiar
- Niño
- Adulto
- Adulto Mayor
Acepta Voluntarios Saludables
Descripción
Criterios de inclusión:
- Médicos registrados en el Consejo Médico y Dental de Pakistán (PMDC) con registro completo o provisional.
- Haber completado el examen de Licenciatura en Medicina, Licenciatura en Cirugía (MBBS). El título equivalente al MBBS en Estados Unidos y Canadá es el Doctor en Medicina (MD).
- Los participantes deben haber completado un programa de formación estructurado sobre el uso de ChatGPT (o un modelo de lenguaje grande comparable), con un total de al menos 10 horas de instrucción. El programa debe incluir práctica práctica relacionada con los aspectos clave del LLM, específicamente la ingeniería de prompts y la evaluación de contenido.
Criterios de exclusión:
- Cualquier otro médico registrado (completo o provisional) con el PMDC (por ejemplo, profesionales con Licenciatura en Cirugía Dental o BDS).
Plan de estudios
¿Cómo está diseñado el estudio?
Detalles de diseño
- Propósito principal: Diagnóstico
- Asignación: Aleatorizado
- Modelo Intervencionista: Asignación paralela
- Enmascaramiento: Único
Armas e Intervenciones
Grupo de participantes/brazo |
Intervención / Tratamiento |
|---|---|
|
Comparador activo: Recomendaciones de ChatGPT junto con un Empujón Conductual
Los participantes evaluarán seis viñetas clínicas.
Durante el ensayo, tendrán acceso a recomendaciones clínicas de un LLM específico y comercialmente disponible (ChatGPT) además de los recursos diagnósticos convencionales.
Las recomendaciones del LLM para tres viñetas contendrán información diagnóstica deliberadamente errónea y para tres viñetas contendrán recomendaciones precisas).
Los casos se presentarán en orden aleatorio.
Los participantes en este brazo recibirán un empujón conductual integrado en la interfaz de recomendaciones del LLM que presenta dos señales cognitivas sincronizadas cuando se expande el panel del LLM: (1) una señal de anclaje que muestra la precisión diagnóstica basal de ChatGPT en conjuntos de datos médicos estándar en la parte superior del panel para establecer expectativas realistas antes de la intervención de la señal ubicada inmediatamente debajo, que muestra las recomendaciones del LLM junto con una señal de confianza codificada por colores específica para el caso.
|
Los participantes en el grupo de tratamiento recibirán una intervención de estímulo conductual integrada en la interfaz de recomendaciones del LLM que presenta dos señales cognitivas sincronizadas cuando se expande el panel del LLM: (1) una señal de anclaje que muestra la precisión diagnóstica de referencia de ChatGPT en conjuntos de datos médicos estándar en la parte superior del panel para establecer expectativas realistas antes de ver la recomendación específica, y (2) una señal de atención selectiva ubicada inmediatamente debajo, que muestra la recomendación del LLM junto con una señal de confianza específica del caso y codificada por colores.
Esta señal se clasifica como roja cuando la confianza media del conjunto cae por debajo de la precisión de referencia establecida, marcando casos de alta incertidumbre que requieren una evaluación crítica; naranja cuando la confianza alcanza o supera la referencia pero permanece por debajo del 100%, destinada a prevenir la complacencia y mantener un escrutinio clínico activo; y verde para un consenso del conjunto del 100%, aunque siguen aplicándose las advertencias de precaución estándar para protegerse contra ello.
|
|
Sin intervención: Recomendaciones de ChatGPT sin un empujón conductual
Los participantes evaluarán seis viñetas clínicas.
Durante el ensayo, tendrán acceso a recomendaciones clínicas de un LLM específico y disponible comercialmente (ChatGPT), además de los recursos diagnósticos convencionales.
Las recomendaciones del LLM para tres viñetas contendrán información diagnóstica deliberadamente errónea.
Los casos se presentarán en orden aleatorio.
Los participantes de este brazo no recibirán ningún impulso conductual.
|
¿Qué mide el estudio?
Medidas de resultado primarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Puntuación de precisión del razonamiento diagnóstico
Periodo de tiempo: Evaluado en un único momento para cada caso, durante la sesión programada de evaluación del razonamiento diagnóstico, que tiene lugar entre 0 y 5 días después de la inscripción del participante.
|
El resultado principal será el porcentaje de aciertos para cada caso, que oscilará entre el 0 y el 100%, donde una puntuación más alta indica un mejor rendimiento diagnóstico.
Para cada caso, se pedirá a los participantes que indiquen sus tres diagnósticos principales, los hallazgos que respaldan cada diagnóstico y los hallazgos que se oponen a cada diagnóstico.
Por cada diagnóstico plausible, los participantes recibirán 1 punto.
Los hallazgos que respaldan el diagnóstico y los hallazgos que se oponen al diagnóstico también se calificarán según su corrección, con 1 punto por cada respuesta correcta.
Posteriormente, se pedirá a los participantes que nombren su diagnóstico principal, que consideren más probable, obteniendo 9 puntos por una respuesta razonable y 18 puntos por la respuesta más precisa.
Finalmente, se pedirá a los participantes que nombren hasta 3 pasos siguientes para evaluar más al paciente, otorgándose 0,5 puntos por una respuesta parcialmente correcta y 1 punto por una respuesta completamente correcta.
El resultado principal se comparará a nivel de caso entre los grupos aleatorizados.
|
Evaluado en un único momento para cada caso, durante la sesión programada de evaluación del razonamiento diagnóstico, que tiene lugar entre 0 y 5 días después de la inscripción del participante.
|
Medidas de resultado secundarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Puntuación de precisión en el diagnóstico de elección principal
Periodo de tiempo: Evaluado en un único momento para cada caso, durante la sesión programada de evaluación del razonamiento diagnóstico, que tiene lugar entre 0 y 5 días después de la inscripción del participante.
|
El resultado secundario medirá el rendimiento de los participantes en la identificación del diagnóstico más probable para cada viñeta clínica.
Tras evaluar cada caso, los participantes seleccionarán su único diagnóstico más probable, que se puntuará en una Escala de Precisión Diagnóstica de Tres Niveles predefinida: 18 puntos para el diagnóstico más preciso, 9 puntos para una alternativa clínicamente razonable y 0 puntos para un diagnóstico incorrecto.
Para cada participante, se calcula una Puntuación de Precisión del Diagnóstico de Elección Principal como (puntos totales obtenidos ÷ puntos máximos posibles) × 100, obteniendo un rango de 0-100 % en el que puntuaciones más altas indican mayor precisión diagnóstica.
Esta puntuación porcentual se comparará a nivel de caso entre los grupos aleatorizados para cuantificar el impacto del sesgo de automatización en la toma de decisiones diagnósticas.
|
Evaluado en un único momento para cada caso, durante la sesión programada de evaluación del razonamiento diagnóstico, que tiene lugar entre 0 y 5 días después de la inscripción del participante.
|
Colaboradores e Investigadores
Patrocinador
Investigadores
- Investigador principal: Muhammad Asadullah Khawaja, MBBS, King Edward Medical University
- Investigador principal: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences (LUMS)
- Investigador principal: Ali Zafar Sheikh, MBBS, Lahore General Hospital
- Investigador principal: Muhammad Junaid Akhtar, MBBS, Children's Hospital, Lahore
- Investigador principal: Muhammad Hamad Alizai, PhD, Lahore University of Management Sciences (LUMS)
Fechas de registro del estudio
Fechas importantes del estudio
Inicio del estudio (Actual)
Finalización primaria (Actual)
Finalización del estudio (Actual)
Fechas de registro del estudio
Enviado por primera vez
Primero enviado que cumplió con los criterios de control de calidad
Publicado por primera vez (Actual)
Actualizaciones de registros de estudio
Última actualización publicada (Actual)
Última actualización enviada que cumplió con los criterios de control de calidad
Última verificación
Más información
Términos relacionados con este estudio
Palabras clave
Términos MeSH relevantes adicionales
Otros números de identificación del estudio
- LUMS-IRB-0412/12192025/IAQ-FWA
Plan de datos de participantes individuales (IPD)
¿Planea compartir datos de participantes individuales (IPD)?
Información sobre medicamentos y dispositivos, documentos del estudio
Estudia un producto farmacéutico regulado por la FDA de EE. UU.
Estudia un producto de dispositivo regulado por la FDA de EE. UU.
Esta información se obtuvo directamente del sitio web clinicaltrials.gov sin cambios. Si tiene alguna solicitud para cambiar, eliminar o actualizar los detalles de su estudio, comuníquese con register@clinicaltrials.gov. Tan pronto como se implemente un cambio en clinicaltrials.gov, también se actualizará automáticamente en nuestro sitio web. .