- ICH GCP
- Registro de ensaios clínicos dos EUA
- Ensaio Clínico NCT07328815
Mitigar o Viés de Automação no Raciocínio Diagnóstico Médico-LLM Usando Estímulos Comportamentais
Mitigar o Viés de Automação no Raciocínio Diagnóstico Médico-LLM Usando Impulsos Comportamentais
O objetivo deste ensaio controlado randomizado é avaliar se os estímulos comportamentais podem reduzir o viés de automação, a aceitação acrítica da produção automatizada, em médicos que utilizam modelos de linguagem de grande escala (LLM) como o ChatGPT-5.1 para a tomada de decisões clínicas.
A principal questão que pretende responder é: Uma intervenção de estímulo comportamental de duplo mecanismo (ancoragem de precisão de base mais sinais de confiança codificados por cores específicos do caso) reduz a aceitação acrítica por parte dos médicos de recomendações de LLM incorretas?
Os investigadores irão comparar médicos que recebem recomendações de LLM juntamente com um estímulo comportamental com aqueles que recebem recomendações de LLM sem o estímulo para avaliar se o estímulo reduz o viés de automação.
Os participantes irão:
- Avaliar seis vinhetas clínicas acompanhadas por recomendações geradas por LLM (metade contendo erros deliberados e clinicamente significativos).
- Grupo de controlo: Poder visualizar as recomendações de LLM em formato padrão sem o estímulo.
- Grupo de tratamento: Poder visualizar a precisão diagnóstica do ChatGPT em conjuntos de dados médicos padrão como uma âncora inicial, depois receber sinais de confiança codificados por cores juntamente com cada recomendação (por exemplo, vermelho para baixa confiança).
- Ter as suas respostas avaliadas por revisores cegos utilizando uma grelha de avaliação desenvolvida por especialistas para detetar a aceitação acrítica de informações erróneas.
Visão geral do estudo
Status
Condições
Intervenção / Tratamento
Descrição detalhada
O viés de automação representa um desafio crítico na prática clínica moderna, especialmente à medida que as ferramentas de inteligência artificial (IA) se tornam cada vez mais integradas nos fluxos de trabalho de saúde. Este fenómeno cognitivo descreve a tendência dos clínicos para favorecer sugestões de sistemas automatizados de tomada de decisão, mesmo quando essas sugestões estão incorretas. À medida que os Modelos de Linguagem de Grande Escala (LLM), como o ChatGPT-5.1, ganham tração em contextos médicos, o seu potencial para reduzir erros e melhorar a eficiência deve ser ponderado face a uma preocupação significativa: estes modelos carecem de validação médica rigorosa e podem amplificar os vieses cognitivos existentes através de recomendações incorretas ou enganadoras.
O surgimento do viés de automação em contextos médicos reflete uma interação complexa de fatores ambientais e psicológicos. As restrições de tempo em ambientes clínicos de elevado volume criam pressão para aceitar recomendações geradas por IA sem um escrutínio adequado. Os incentivos financeiros que priorizam a eficiência em detrimento do rigor podem desencorajar ainda mais a avaliação crítica necessária para um julgamento clínico sólido. A fadiga cognitiva durante turnos prolongados diminui a capacidade dos médicos para um pensamento analítico sustentado. Estas pressões interagem com mecanismos psicológicos, incluindo a difusão de responsabilidade, excesso de confiança em soluções tecnológicas e a descarga cognitiva, criando coletivamente condições em que a aceitação acrítica de recomendações geradas por IA se torna mais provável.
Este ensaio controlado randomizado avalia a eficácia de uma intervenção de estímulo comportamental concebida para mitigar o viés de automação entre médicos que utilizam recomendações de diagnóstico geradas por LLM. O objetivo principal é determinar se esta intervenção melhora as pontuações de desempenho do raciocínio diagnóstico ao avaliar vinhetas clínicas que incluem recomendações de LLM deliberadamente falhas. Os objetivos secundários incluem avaliar se o nível de experiência do médico, o género e a experiência prévia com LLM moderam a eficácia da intervenção, e determinar a eficácia diferencial para vinhetas com diferentes sinais de confiança.
Este estudo emprega um ensaio controlado randomizado de simples-cego com dois braços paralelos. Os participantes serão aleatoriamente atribuídos 1:1 ao braço de intervenção ou ao braço de controlo. Para eliminar a variabilidade decorrente de diferenças nas competências de formulação de prompts, os participantes não interagirão diretamente com uma interface de LLM em tempo real. Em vez disso, todos os participantes utilizarão uma plataforma web personalizada que exibe vinhetas clínicas com recomendações de LLM pré-geradas, garantindo conteúdo gerado por LLM idêntico para cada vinheta.
Todos os participantes avaliarão seis vinhetas clínicas durante uma única sessão supervisionada com duração aproximada de 75 minutos. Três vinhetas conterão falhas de raciocínio clínico deliberadamente introduzidas nas recomendações do LLM, enquanto três conterão recomendações corretas. As vinhetas serão apresentadas numa ordem aleatória para evitar a deteção de padrões.
Os participantes do braço de controlo avaliarão vinhetas clínicas com recomendações de diagnóstico de LLM geradas pelo ChatGPT, apresentadas num formato de texto padrão e neutro, sem informações contextuais adicionais. Os participantes do braço de intervenção avaliarão as mesmas vinhetas juntamente com um estímulo comportamental. Esta intervenção consiste em duas pistas cognitivas sincronizadas: (1) uma pista de ancoragem que exibe a precisão diagnóstica de base do ChatGPT em conjuntos de dados médicos padrão no topo do painel da interface, ancorando explicitamente as expectativas à falibilidade do modelo, e (2) uma pista de atenção seletiva que exibe a recomendação do LLM juntamente com um sinal de confiança codificado por cores, gerado através de uma avaliação por conjunto: três LLM independentes de última geração (Claude Sonnet 4.5, Gemini 2.5 Pro Thinking e GPT-5.1) fornecem cada um classificações de confiança para a recomendação, e a confiança média determina a cor do sinal para mitigar a má calibração de um único modelo.
Os sinais de confiança codificados por cores são categorizados em três níveis distintos com base na confiança média do conjunto em relação à precisão diagnóstica de base. Os sinais vermelhos são acionados quando a confiança média fica abaixo da precisão de base estabelecida do ChatGPT, sinalizando explicitamente casos de elevada incerteza que exigem um escrutínio crítico intensificado. Os sinais laranja indicam que, embora a confiança média exceda a média de base, permanece abaixo de 100%, sinalizando a necessidade de vigilância clínica contínua e evitando a complacência. Finalmente, os sinais verdes são reservados para instâncias de consenso do conjunto a 100%; no entanto, mesmo a este nível de confiança, os avisos padrão de segurança de IA permanecem presentes para proteger contra a dependência excessiva do resultado do sistema.
Aos participantes serão apresentadas seis vinhetas clínicas especificamente concebidas para medir o viés de automação, obtidas e modificadas a partir de casos reais que representam uma variedade de dificuldade diagnóstica e especialidades médicas comuns. Cada vinheta segue um formato padronizado que inclui queixa principal, história da doença atual, história médica/social/familiar relevante, achados do exame físico e resultados laboratoriais iniciais.
O desfecho principal é a Pontuação de Desempenho do Raciocínio Diagnóstico, uma pontuação percentual composta baseada numa grelha estruturada que avalia: qualidade dos diagnósticos diferenciais, achados de suporte, achados opostos, precisão do diagnóstico final e adequação dos próximos passos. Os desfechos secundários incluem a precisão do diagnóstico de primeira escolha (incorreto, parcialmente correto ou correto). Todas as respostas serão avaliadas por revisores cegos utilizando a grelha de avaliação.
Tipo de estudo
Inscrição (Real)
Estágio
- Não aplicável
Contactos e Locais
Locais de estudo
-
-
Punjab Province
-
Lahore, Punjab Province, Paquistão, 54792
- Lahore University of Management Sciences
-
-
Critérios de participação
Critérios de elegibilidade
Idades elegíveis para estudo
- Filho
- Adulto
- Adulto mais velho
Aceita Voluntários Saudáveis
Descrição
Critérios de Inclusão:
- Médicos registados a título definitivo ou provisório no Conselho Médico e Dentário do Paquistão (PMDC).
- Concluíram o exame de Licenciatura em Medicina, Licenciatura em Cirurgia (MBBS). O grau equivalente ao MBBS nos EUA e Canadá é o Doutor em Medicina (MD).
- Os participantes devem ter concluído um programa de formação estruturado sobre a utilização do ChatGPT (ou um modelo de linguagem de grande dimensão comparável), totalizando pelo menos 10 horas de instrução. O programa deve incluir prática relacionada com os aspetos-chave dos LLM, especificamente engenharia de prompts e avaliação de conteúdo.
Critérios de Exclusão:
- Quaisquer outros Médicos registados (a título definitivo ou provisório) no PMDC (por exemplo, profissionais com Licenciatura em Cirurgia Dentária ou BDS).
Plano de estudo
Como o estudo é projetado?
Detalhes do projeto
- Finalidade Principal: Diagnóstico
- Alocação: Randomizado
- Modelo Intervencional: Atribuição Paralela
- Mascaramento: Solteiro
Armas e Intervenções
Grupo de Participantes / Braço |
Intervenção / Tratamento |
|---|---|
|
Comparador Ativo: Recomendações do ChatGPT juntamente com um Impulso Comportamental
Os participantes avaliarão seis vinhetas clínicas.
Durante o ensaio, terão acesso a recomendações clínicas de um LLM específico e comercialmente disponível (ChatGPT) além dos recursos de diagnóstico convencionais.
As recomendações do LLM para três vinhetas conterão deliberadamente informações de diagnóstico incorretas e para três vinhetas conterão recomendações precisas.
Os casos serão apresentados de forma aleatória.
Os participantes deste braço receberão um incentivo comportamental incorporado na interface de recomendações do LLM que apresenta duas pistas cognitivas sincronizadas quando o painel do LLM é expandido: (1) uma pista de ancoragem que exibe a precisão de diagnóstico de base do ChatGPT em conjuntos de dados médicos padrão na parte superior do painel para definir expectativas realistas antes da intervenção da pista localizada imediatamente abaixo, que mostra as recomendações do LLM juntamente com um sinal de confiança codificado por cores específico do caso.
|
Os participantes do grupo de tratamento receberão uma intervenção de estímulo comportamental incorporada na interface de recomendações do LLM que apresenta duas pistas cognitivas sincronizadas quando o painel do LLM é expandido: (1) uma pista de ancoragem que exibe a precisão diagnóstica de base do ChatGPT em conjuntos de dados médicos padrão no topo do painel para estabelecer expectativas realistas antes de visualizar a recomendação específica, e (2) uma pista de atenção seletiva localizada imediatamente abaixo, que mostra a recomendação do LLM juntamente com um sinal de confiança específico para o caso e codificado por cores.
Este sinal é categorizado como vermelho quando a confiança média do conjunto fica abaixo da precisão de base estabelecida, sinalizando casos de elevada incerteza que exigem avaliação crítica; laranja quando a confiança atinge ou excede a base, mas permanece abaixo de 100%, destinado a prevenir a complacência e manter o escrutínio clínico ativo; e verde para um consenso de conjunto de 100%, embora os avisos cautelares padrão ainda se apliquem para salvaguardar contra.
|
|
Sem intervenção: Recomendações do ChatGPT sem um Impulso Comportamental
Os participantes irão avaliar seis vinhetas clínicas.
Durante o ensaio, terão acesso a recomendações clínicas de um LLM específico, disponível comercialmente (ChatGPT), além dos recursos de diagnóstico convencionais.
As recomendações do LLM para três vinhetas conterão informações de diagnóstico deliberadamente erradas.
Os casos serão apresentados de forma aleatória.
Os participantes neste braço não receberão qualquer estímulo comportamental.
|
O que o estudo está medindo?
Medidas de resultados primários
Medida de resultado |
Descrição da medida |
Prazo |
|---|---|---|
|
Pontuação de precisão do raciocínio diagnóstico
Prazo: Avaliado num único momento para cada caso, durante a sessão agendada de avaliação do raciocínio diagnóstico, que ocorre entre 0-5 dias após a inscrição do participante.
|
O resultado primário será a percentagem de acertos para cada caso, variando de 0 a 100%, em que pontuações mais elevadas indicam um melhor desempenho diagnóstico.
Para cada caso, será pedido aos participantes que indiquem os seus três principais diagnósticos, os achados que suportam cada diagnóstico e os achados que se opõem a cada diagnóstico.
Para cada diagnóstico plausível, os participantes receberão 1 ponto.
Os achados que suportam o diagnóstico e os achados que se opõem ao diagnóstico também serão classificados com base na correção, com 1 ponto para cada resposta correta.
Em seguida, será pedido aos participantes que nomeiem o seu principal diagnóstico, que consideram ser o mais provável, recebendo 9 pontos por uma resposta razoável e 18 pontos pela resposta mais precisa.
Por fim, será pedido aos participantes que nomeiem até 3 próximos passos para avaliar melhor o paciente, sendo atribuídos 0,5 ponto por uma resposta parcialmente correta e 1 ponto por uma resposta completamente correta.
O resultado primário será comparado ao nível do caso entre os grupos randomizados.
|
Avaliado num único momento para cada caso, durante a sessão agendada de avaliação do raciocínio diagnóstico, que ocorre entre 0-5 dias após a inscrição do participante.
|
Medidas de resultados secundários
Medida de resultado |
Descrição da medida |
Prazo |
|---|---|---|
|
Pontuação de precisão do diagnóstico de primeira escolha
Prazo: Avaliado num único momento para cada caso, durante a sessão programada de avaliação do raciocínio diagnóstico, que ocorre entre 0-5 dias após a inscrição do participante.
|
O desfecho secundário irá medir o desempenho dos participantes na identificação do diagnóstico mais provável para cada vinheta clínica.
Após avaliar cada caso, os participantes irão selecionar o seu único diagnóstico mais provável, que será pontuado numa Escala de Precisão Diagnóstica de Três Níveis pré-definida: 18 pontos para o diagnóstico mais preciso, 9 pontos para uma alternativa clinicamente razoável e 0 pontos para um diagnóstico incorreto.
Para cada participante, é calculada uma Pontuação de Precisão do Diagnóstico de Escolha Principal como (total de pontos obtidos ÷ pontos máximos possíveis) × 100, resultando numa faixa de 0-100 % em que pontuações mais elevadas indicam maior precisão diagnóstica.
Esta percentagem será comparada ao nível do caso entre os grupos randomizados para quantificar o impacto do viés de automação na tomada de decisão diagnóstica.
|
Avaliado num único momento para cada caso, durante a sessão programada de avaliação do raciocínio diagnóstico, que ocorre entre 0-5 dias após a inscrição do participante.
|
Colaboradores e Investigadores
Patrocinador
Investigadores
- Investigador principal: Muhammad Asadullah Khawaja, MBBS, King Edward Medical University
- Investigador principal: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences (LUMS)
- Investigador principal: Ali Zafar Sheikh, MBBS, Lahore General Hospital
- Investigador principal: Muhammad Junaid Akhtar, MBBS, Children's Hospital, Lahore
- Investigador principal: Muhammad Hamad Alizai, PhD, Lahore University of Management Sciences (LUMS)
Datas de registro do estudo
Datas Principais do Estudo
Início do estudo (Real)
Conclusão Primária (Real)
Conclusão do estudo (Real)
Datas de inscrição no estudo
Enviado pela primeira vez
Enviado pela primeira vez que atendeu aos critérios de CQ
Primeira postagem (Real)
Atualizações de registro de estudo
Última Atualização Postada (Real)
Última atualização enviada que atendeu aos critérios de controle de qualidade
Última verificação
Mais Informações
Termos relacionados a este estudo
Palavras-chave
Termos MeSH relevantes adicionais
Outros números de identificação do estudo
- LUMS-IRB-0412/12192025/IAQ-FWA
Plano para dados de participantes individuais (IPD)
Planeja compartilhar dados de participantes individuais (IPD)?
Informações sobre medicamentos e dispositivos, documentos de estudo
Estuda um medicamento regulamentado pela FDA dos EUA
Estuda um produto de dispositivo regulamentado pela FDA dos EUA
Essas informações foram obtidas diretamente do site clinicaltrials.gov sem nenhuma alteração. Se você tiver alguma solicitação para alterar, remover ou atualizar os detalhes do seu estudo, entre em contato com register@clinicaltrials.gov. Assim que uma alteração for implementada em clinicaltrials.gov, ela também será atualizada automaticamente em nosso site .