- ICH GCP
- Registro de ensaios clínicos dos EUA
- Ensaio Clínico NCT07352475
Enriquecimento do Raciocínio com Feedback de IA em Estudo de Nefrologia (REFINe)
Melhoria do Raciocínio com Feedback de uma IA Generativa em Nefrologia (REFINe): Uma Avaliação Randomizada do Apoio da IA Generativa no Diagnóstico Nefrológico
O objetivo deste ensaio clínico é aprender como a inteligência artificial (IA) pode ajudar os médicos a fazer diagnósticos em nefrologia. Os investigadores pretendem saber se uma ferramenta de IA chamada modelo de linguagem de grande escala (LLM) pode ajudar os médicos a escolher o diagnóstico correto com mais frequência e a sentirem-se mais confiantes nas suas respostas.
Antes de iniciar o estudo, a equipa de investigação testou vários modelos de IA e escolheu um dos melhores, um modelo da classe GPT-5 configurado para utilizar um elevado esforço de raciocínio.
As principais questões que este estudo pretende responder são:
- Os médicos fazem mais diagnósticos corretos quando podem ver sugestões de IA?
- Ver sugestões de IA altera a confiança que os médicos sentem no seu diagnóstico?
Os investigadores irão comparar médicos que recebem sugestões de IA com médicos que não recebem sugestões de IA para ver como a IA afeta a precisão, a confiança e a tomada de decisões.
Os participantes irão completar até 10 casos clínicos online. Para cada caso, irão:
- Ler um breve cenário médico
- Sugerir até três diagnósticos possíveis
(Se estiverem no grupo de IA) Rever as sugestões da IA e decidir se alteram a sua resposta
O estudo também irá analisar quanto tempo os participantes demoram a responder a cada caso e como o desempenho da IA se compara com as respostas humanas.
Visão geral do estudo
Status
Condições
Intervenção / Tratamento
Descrição detalhada
Este estudo avalia se fornecer aos clínicos sugestões de diagnóstico em tempo real de um modelo de linguagem de grande capacidade de raciocínio (GPT-5) melhora a precisão, a confiança e a eficiência diagnóstica ao resolver vinhetas clínicas de nefrologia. Antes de selecionar o modelo para o ensaio, a equipa de investigação comparou vários modelos de última geração num conjunto piloto de casos de nefrologia, incluindo: GPT-5, GPT-5-mini, O3, GPT-4o, Llama-4 Maverick-17B, Gemini-2.5-Pro, Qwen-3 VL-235B Thinking, DeepSeek-V3.2-Exp, MedGEMMA-27B, Claude Sonnet-4.5 e Magistral-Medium-2509. O GPT-5 (alta capacidade de raciocínio) demonstrou o melhor desempenho, estabilidade e interpretabilidade diagnóstica, e foi selecionado como o sistema de IA utilizado no braço de intervenção.
Os participantes incluem estudantes de medicina, internos, especializandos e médicos em exercício. Após criar uma conta, os participantes preenchem um questionário demográfico (especialidade, anos de experiência, tipo de prática, faixa etária, familiaridade com IA) e devem concordar explicitamente com a utilização destes dados para fins de investigação antes de acederem às vinhetas. Não são recolhidas informações diretamente identificativas.
Os participantes são randomizados (com estratificação por estatuto profissional) para o braço apoiado por IA ou para o braço de controlo. Cada participante recebe 10 vinhetas de nefrologia em francês ou inglês e pode completá-las em várias sessões. Uma vez submetida uma vinheta, esta não pode ser revisitada ("sem retrocesso"). O tempo de conclusão por vinheta é automaticamente registado.
Braço de Controlo
Os participantes visualizam cada vinheta e fornecem até três diagnósticos ("Top-3"), seguidos de uma classificação de confiança (0-10).
Braço Apoiado por IA
Os participantes introduzem primeiro um diagnóstico inicial Top-3 e uma classificação de confiança sem assistência da IA. O sistema exibe então as sugestões de diagnóstico do GPT-5, após o que os participantes podem rever os seus diagnósticos uma vez. A vinheta é bloqueada após a submissão.
O estudo recolhe:
- diagnósticos iniciais e finais,
- classificações de confiança antes e (se aplicável) após as sugestões de IA,
- tempos de conclusão,
- variáveis demográficas dos participantes,
- e os resultados diagnósticos próprios do modelo de IA.
É permitida a conclusão parcial; todas as vinhetas concluídas contribuem para a análise.
Os desfechos primários e secundários incluem precisão diagnóstica (Top-3 e Top-1), melhoria da precisão antes vs. após a IA, alterações na confiança diagnóstica, erros de diagnóstico induzidos por IA, benchmarking humano vs. IA, métricas de eficiência do tempo de conclusão e proporção de vinhetas atribuídas concluídas.
A análise primária comparará a precisão diagnóstica entre o braço de controlo (médicos sozinhos) e o braço experimental (médicos assistidos pelo modelo de IA). A precisão é analisada como um resultado binário (diagnóstico correto vs. incorreto). Como cada participante avalia múltiplas vinhetas clínicas, a precisão será modelada usando uma regressão logística de efeitos mistos com um efeito fixo para o braço do estudo e interceptos aleatórios tanto para o participante como para a vinheta. Esta abordagem contabiliza o agrupamento e a dificuldade variável entre casos. O teste de hipótese primário utiliza um α bilateral = 0,05. Os tamanhos do efeito serão reportados como razões de probabilidades com intervalos de confiança de 95%. Análises secundárias explorarão se a precisão varia por fatores demográficos (por exemplo, nível de experiência, especialidade) usando termos de interação.
Como cada participante avalia múltiplas vinhetas, a equipa também realizou análises de poder baseadas em simulação usando modelos de regressão logística de efeitos mistos com interceptos aleatórios tanto para o participante como para a vinheta, assumindo um ICC intra-participante de 0,10. Sob estas premissas, uma amostra total de 100 participantes (50 por braço) com 10 vinhetas por participante fornece um poder >99% para detetar uma melhoria clinicamente significativa na precisão diagnóstica. Os investigadores planeiam, portanto, recrutar aproximadamente 100 participantes no total.
Este estudo visa quantificar se o raciocínio aumentado por IA melhora significativamente o desempenho e a tomada de decisão diagnóstica quando os clínicos avaliam casos complexos de nefrologia.
Tipo de estudo
Inscrição (Estimado)
Estágio
- Não aplicável
Contactos e Locais
Contato de estudo
- Nome: Raphaël BENTEGEAC, MD, MPH
- Número de telefone: +33651204000
- E-mail: raphael.bentegeac@univ-lille.fr
Locais de estudo
-
-
-
Lille, França, 59000
- Recrutamento
- Lille University Hospital (online study)
-
Contato:
- Raphaël BENTEGEAC, MD, MPH
- Número de telefone: +33651204000
- E-mail: raphael.bentegeac@chu-lille.fr
-
Contato:
- Aghiles HAMROUN, MD, PhD
- E-mail: aghiles.hamroun@univ-lille.fr
-
-
Critérios de participação
Critérios de elegibilidade
Idades elegíveis para estudo
- Adulto
- Adulto mais velho
Aceita Voluntários Saudáveis
Descrição
Critérios de Inclusão:
Adultos com 18 anos ou mais.
Capacidade de ler e responder a vinhetas clínicas em inglês ou francês.
Acesso a um computador ou smartphone com ligação à Internet.
Fornecimento de consentimento informado online.
Espera-se que os participantes tenham pelo menos formação médica básica (por exemplo, estudantes de medicina, internos, especializandos ou clínicos em exercício), embora não seja necessária verificação formal.
Critérios de Exclusão:
Indivíduos com menos de 18 anos de idade.
Incapacidade de completar os procedimentos do estudo online.
Participação anterior na conceção, desenvolvimento ou avaliação do sistema de IA utilizado neste estudo.
Plano de estudo
Como o estudo é projetado?
Detalhes do projeto
- Finalidade Principal: Diagnóstico
- Alocação: Randomizado
- Modelo Intervencional: Atribuição Paralela
- Mascaramento: Nenhum (rótulo aberto)
Armas e Intervenções
Grupo de Participantes / Braço |
Intervenção / Tratamento |
|---|---|
|
Experimental: Grupo com sugestões de IA
Os participantes neste braço completarão os mesmos casos clínicos do grupo de controlo.
Para cada caso, receberão um diagnóstico sugerido gerado por um modelo de linguagem de grande escala (GPT-5, configuração de alto raciocínio), que foi selecionado após benchmarking interno.
Os participantes podem rever a sugestão da IA antes de introduzir a sua própria resposta diagnóstica final.
Não é fornecida qualquer informação, instrução ou orientação adicional.
A intervenção consiste unicamente em mostrar a sugestão diagnóstica gerada pela IA durante a tarefa de resolução do caso.
|
Esta intervenção consiste na apresentação de uma sugestão de diagnóstico gerada por IA durante a tarefa de resolução de casos clínicos.
Após ler cada vinheta, os participantes veem a principal proposta de diagnóstico produzida por um modelo de linguagem de grande escala (GPT-5, configuração de alto raciocínio), selecionada após avaliação interna comparativa.
A sugestão da IA aparece uma vez por vinheta e não pode ser solicitada novamente ou modificada.
Os participantes podem rever a sua resposta de diagnóstico após visualizar a sugestão, mas não podem voltar à vinheta posteriormente.
Não são fornecidas orientações adicionais, treino ou funcionalidades interativas.
|
|
Sem intervenção: Grupo sem sugestões de IA
Os participantes deste braço completarão os casos clínicos de forma independente, sem quaisquer sugestões de diagnóstico geradas por IA.
Lerão cada caso clínico e fornecerão a sua própria resposta diagnóstica baseada apenas na informação apresentada.
Não é fornecido qualquer apoio à decisão externo ou materiais adicionais.
|
O que o estudo está medindo?
Medidas de resultados primários
Medida de resultado |
Descrição da medida |
Prazo |
|---|---|---|
|
Precisão diagnóstica final (top-3) com vs sem suporte de IA
Prazo: Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
Para cada participante, proporção de vinhetas onde o diagnóstico principal correto está incluído nos 3 principais diagnósticos finais do participante. Comparar a precisão dos 3 principais diagnósticos finais entre o braço de IA (após sugestões de IA) e o braço de controlo (sem IA). Percentagem de casos diagnosticados corretamente (3 principais). |
Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
Medidas de resultados secundários
Medida de resultado |
Descrição da medida |
Prazo |
|---|---|---|
|
Precisão do diagnóstico final (top-1) com vs sem suporte de IA
Prazo: Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
Para cada participante, proporção de vinhetas onde o diagnóstico principal correto está incluído nos diagnósticos finais top-1 do participante.
Comparar a precisão final top-1 entre o braço de IA (após sugestões de IA) e o braço de controlo (sem IA).
Percentagem de casos diagnosticados corretamente (top-1).
|
Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
|
Alteração na precisão diagnóstica dos 3 principais diagnósticos antes e depois das sugestões de IA (apenas braço de IA)
Prazo: Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
No braço apoiado por IA, os participantes fornecem primeiro uma resposta inicial (até três diagnósticos) sem sugestões de IA, depois veem sugestões geradas por IA e podem rever a sua resposta uma vez; não podem regressar a essa vinheta mais tarde. Para cada participante, os investigadores calculam a diferença na precisão dos três primeiros diagnósticos entre as respostas iniciais e finais em todas as vinhetas concluídas. Variação percentual na precisão dos três primeiros diagnósticos |
Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
|
Alteração na precisão diagnóstica top-1 antes vs depois das sugestões da IA (apenas braço da IA)
Prazo: Desde o primeiro vinheta respondida até ao fim do estudo (até 12 meses).
|
No braço apoiado por IA, os participantes fornecem primeiro uma resposta inicial (até três diagnósticos) sem sugestões de IA, depois veem sugestões geradas por IA e podem rever a sua resposta uma vez; não podem voltar a esse caso clínico mais tarde. Para cada participante, os investigadores calculam a diferença na precisão top-1 entre as respostas iniciais e finais em todos os casos clínicos completados. Alteração em pontos percentuais na precisão diagnóstica Top-1 |
Desde o primeiro vinheta respondida até ao fim do estudo (até 12 meses).
|
|
Confiança diagnóstica (0-10) antes das sugestões de IA: Grupo de controlo vs Grupo de IA
Prazo: Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
Os participantes em ambos os braços classificam a sua confiança (escala 0-10) na sua proposta de diagnóstico Top-3 antes de qualquer sugestão de IA. No braço de IA, esta é a classificação "pré-IA". No braço de Controlo, esta é a única classificação de confiança (uma vez que não é mostrada IA). Os investigadores comparam a confiança pré-IA entre os braços, agregada em todas as vinhetas concluídas por participante. |
Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
|
Confiança no diagnóstico final (0-10) após sugestões de IA: Braço de controlo vs braço de IA
Prazo: Desde a primeira vinheta respondida até ao fim do estudo (até 12 meses).
|
Confiança diagnóstica final (escala 0-10) nas 3 principais propostas de diagnóstico em todas as vinhetas concluídas, comparada entre os braços do estudo. No braço de IA, esta é a classificação de confiança pós-IA. No braço de controlo, esta é a mesma classificação de confiança (os participantes não recebem sugestões de IA). |
Desde a primeira vinheta respondida até ao fim do estudo (até 12 meses).
|
|
Alteração na confiança diagnóstica (0-10) antes vs depois das sugestões de IA (apenas braço de IA)
Prazo: Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
No braço de IA, os participantes fornecem classificações de confiança (escala de 0-10) para os seus 3 diagnósticos principais, tanto antes como depois de verem as sugestões de IA. Para cada participante, os investigadores calculam a mudança intra-participante (pós-IA menos pré-IA) em todas as vinhetas concluídas. Alteração na pontuação de confiança (escala de 0-10) |
Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
|
Erro de diagnóstico induzido por IA (apenas braço de IA)
Prazo: Desde o primeiro cenário respondido até ao final do estudo (até 12 meses).
|
Entre as vinhetas concluídas em que o diagnóstico inicial Top-1 do participante está correto, proporção para a qual o diagnóstico final Top-1 se torna incorreto após as sugestões da IA.
|
Desde o primeiro cenário respondido até ao final do estudo (até 12 meses).
|
|
Alteração no Top-3 de diagnósticos após sugestões de IA (apenas grupo de IA)
Prazo: Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
Entre os casos clínicos completados no braço de IA, a proporção em que o Top-3 de diagnósticos difere entre as respostas pré-IA e pós-IA.
|
Desde a primeira vinheta respondida até ao final do estudo (até 12 meses).
|
|
Top-3 de precisão diagnóstica: Todas as respostas humanas antes da IA vs precisão da IA
Prazo: Desde o primeiro vinheta respondida até ao final do estudo (até 12 meses).
|
Para cada vinheta, a precisão diagnóstica Top-3 dos participantes humanos antes de qualquer sugestão de IA (combinando participantes de ambos os braços do estudo na sua fase pré-IA) é comparada com a precisão diagnóstica Top-3 do modelo de IA para a mesma vinheta. O Resultado reportado é a diferença de precisão, definida como a precisão Top-3 da IA menos a precisão Top-3 humana pré-IA, expressa em pontos percentuais e calculada ao nível da vinheta em todas as vinhetas concluídas. Diferença em pontos percentuais na precisão diagnóstica Top-3 |
Desde o primeiro vinheta respondida até ao final do estudo (até 12 meses).
|
|
Top-3 de precisão diagnóstica: Respostas finais humanas após IA vs precisão da IA (apenas braço IA)
Prazo: Desde o primeiro vinheta respondida até ao final do estudo (até 12 meses).
|
Para cada vinheta concluída no braço apoiado por IA, a precisão diagnóstica Top-3 dos participantes humanos após visualizarem as sugestões da IA é comparada com a precisão diagnóstica Top-3 do modelo de IA. (A precisão Top-3 é uma medida única) O Resultado reportado é a diferença de precisão, definida como a precisão Top-3 da IA menos a precisão Top-3 humana pós-IA, expressa em pontos percentuais e calculada ao nível da vinheta em todas as vinhetas concluídas no braço de IA. Diferença em pontos percentuais na precisão diagnóstica Top-3 entre IA e humano |
Desde o primeiro vinheta respondida até ao final do estudo (até 12 meses).
|
|
Tempo de conclusão por vinheta com e sem suporte de IA
Prazo: Desde o primeiro vinheta respondida até ao final do estudo (até 12 meses).
|
Para cada vinheta, a plataforma regista o tempo desde a abertura da vinheta até ao envio da resposta. No braço de controlo, é registado um único tempo de conclusão para cada vinheta. No braço com apoio de IA, o tempo de conclusão é registado antes de ver as sugestões de IA e novamente após ver as sugestões de IA. O Resultado reporta a diferença no tempo de conclusão entre os braços do estudo, expressa em segundos e calculada para todas as vinhetas concluídas. Segundos (diferença no tempo de conclusão) |
Desde o primeiro vinheta respondida até ao final do estudo (até 12 meses).
|
|
Proporção de vinhetas atribuídas concluídas
Prazo: Desde o primeiro vinheta respondida até ao final do estudo (até 12 meses).
|
Para cada participante, a proporção dos 10 vinhetas concluídas dentro do período do estudo, comparada entre os braços.
|
Desde o primeiro vinheta respondida até ao final do estudo (até 12 meses).
|
Colaboradores e Investigadores
Patrocinador
Datas de registro do estudo
Datas Principais do Estudo
Início do estudo (Real)
Conclusão Primária (Estimado)
Conclusão do estudo (Estimado)
Datas de inscrição no estudo
Enviado pela primeira vez
Enviado pela primeira vez que atendeu aos critérios de CQ
Primeira postagem (Real)
Atualizações de registro de estudo
Última Atualização Postada (Real)
Última atualização enviada que atendeu aos critérios de controle de qualidade
Última verificação
Mais Informações
Termos relacionados a este estudo
Palavras-chave
Termos MeSH relevantes adicionais
Outros números de identificação do estudo
- CHUL-191125
Informações sobre medicamentos e dispositivos, documentos de estudo
Estuda um medicamento regulamentado pela FDA dos EUA
Estuda um produto de dispositivo regulamentado pela FDA dos EUA
Essas informações foram obtidas diretamente do site clinicaltrials.gov sem nenhuma alteração. Se você tiver alguma solicitação para alterar, remover ou atualizar os detalhes do seu estudo, entre em contato com register@clinicaltrials.gov. Assim que uma alteração for implementada em clinicaltrials.gov, ela também será atualizada automaticamente em nosso site .