- ICH GCP
- Registro de ensaios clínicos dos EUA
- Ensaio Clínico NCT06911645
Raciocínio de diagnóstico com modelo GPT-4 personalizado
Avaliando o desempenho dos LLMs e médicos em casos de diagnóstico complexos: um estudo controlado randomizado
Visão geral do estudo
Status
Condições
Descrição detalhada
As tecnologias de inteligência artificial (IA), particularmente modelos avançados de idiomas como o ChatGPT da OpenAI, têm o potencial de melhorar a tomada de decisões médicas. Embora o ChatGPT-4 não tenha sido projetado especificamente para aplicações médicas, ele demonstrou promessa em vários contextos de saúde, incluindo redação médica, abordando consultas de pacientes e facilitando consultas médicas. No entanto, seu impacto no raciocínio diagnóstico dos médicos permanece amplamente desconhecido.
O raciocínio clínico é um processo complexo que envolve reconhecimento de padrões, aplicação de conhecimento e raciocínio probabilístico. A integração de ferramentas de IA como ChatGPT-4 nos fluxos de trabalho médicos pode ajudar a reduzir a carga de trabalho do clínico e diminuir a probabilidade de diagnósticos perdidos. No entanto, o ChatGPT-4 não foi desenvolvido nem validado para o raciocínio de diagnóstico, e pode produzir informações enganosas, incluindo conclusões plausíveis, mas incorretas, que poderiam despertar os médicos. Se não for usado adequadamente, pode não melhorar e pode até impedir a tomada de decisões clínicas. Portanto, é essencial estudar como os médicos usam grandes modelos de linguagem para apoiar o raciocínio clínico antes de integrá -los ao atendimento de rotina do paciente.
Este estudo examinará como o acesso imediato a uma versão personalizada do ChatGPT-4 afeta o desempenho nas tarefas de raciocínio de diagnóstico baseadas em casos, em comparação com uma abordagem gradual. Na abordagem Stepwise, os participantes primeiro usarão ferramentas tradicionais de suporte à decisão de diagnóstico para apoiar o raciocínio de casos antes de interagir com um modelo CHATGPT-4 personalizado, quando terão a oportunidade de revisar suas respostas iniciais.
Os participantes serão randomizados em diferentes braços de estudo e responderão a casos de diagnóstico, fornecendo três diagnósticos diferenciais, além de apoiar e opostos achados para cada um. Eles também identificarão seu principal diagnóstico e proporão as próximas etapas de diagnóstico. Os revisores independentes, cegos para a tarefa de tratamento, avaliarão suas respostas.
Tipo de estudo
Inscrição (Real)
Estágio
- Não aplicável
Contactos e Locais
Locais de estudo
-
-
California
-
Palo Alto, California, Estados Unidos, 94305
- Stanford University
-
-
Critérios de participação
Critérios de elegibilidade
Idades elegíveis para estudo
- Filho
- Adulto
- Adulto mais velho
Aceita Voluntários Saudáveis
Descrição
Critérios de inclusão:
- Os participantes devem ser médicos licenciados e completarem pelo menos o ano 1 de pós-graduação (PGY1) de treinamento médico.
- Treinamento em medicina interna, medicina de família ou medicina de emergência.
Critérios de exclusão:
- Atualmente não está praticando clinicamente.
- Participou de um de nossos estudos anteriores que usaram os mesmos seis casos de diagnóstico.
Plano de estudo
Como o estudo é projetado?
Detalhes do projeto
- Finalidade Principal: Diagnóstico
- Alocação: Randomizado
- Modelo Intervencional: Atribuição Paralela
- Mascaramento: Solteiro
Armas e Intervenções
Grupo de Participantes / Braço |
Intervenção / Tratamento |
|---|---|
|
Comparador Ativo: Acesso imediato à versão personalizada do GPT-4
O grupo será incentivado a usar imediatamente uma versão personalizada do GPT-4.
|
O grupo recebe acesso imediato a uma versão personalizada do GPT-4 para apoiar seu raciocínio diagnóstico para cada caso.
|
|
Comparador Ativo: Recursos convencionais primeiro e depois concederam acesso à versão personalizada do GPT-4.
O grupo será incentivado a usar primeiro os recursos que desejarem, além de grandes modelos de idiomas (Uptodate, PubMed, Google etc) e terá acesso a uma versão personalizada do GPT-4.
|
O grupo é incentivado a raciocinar por meio de casos de diagnóstico com o apoio de recursos convencionais.
Depois de enviarem as respostas de um caso, eles têm acesso a uma versão personalizada do GPT-4 e têm a oportunidade de alterar suas respostas iniciais.
|
O que o estudo está medindo?
Medidas de resultados primários
Medida de resultado |
Descrição da medida |
Prazo |
|---|---|---|
|
Raciocínio diagnóstico
Prazo: Através da conclusão do estudo, uma média de 6 meses
|
O desfecho primário será a porcentagem de respostas corretas por caso (intervalo: 0 a 100).
Para cada caso, os participantes serão solicitados a fornecer seus três principais diagnósticos diferenciais, além de apoiar e adquirir descobertas para cada um.
Eles receberão 1 ponto para cada diagnóstico plausível.
As descobertas de apoio e opostas serão classificadas com base na correção, com 1 ponto para uma resposta parcialmente correta e 2 pontos para uma resposta completamente correta.
Os participantes selecionarão seu principal diagnóstico, ganhando 1 ponto para uma escolha razoável e 2 pontos para o diagnóstico mais preciso.
Finalmente, eles listarão até três próximas etapas para avaliação adicional do paciente, com 1 ponto concedido por uma resposta parcialmente correta e 2 pontos para uma resposta completamente correta.
O desfecho primário será analisado no nível do caso, comparando o desempenho entre os grupos de estudo randomizados.
|
Através da conclusão do estudo, uma média de 6 meses
|
Medidas de resultados secundários
Medida de resultado |
Descrição da medida |
Prazo |
|---|---|---|
|
Tempo gasto por caso
Prazo: Através da conclusão do estudo, uma média de 6 meses
|
Os investigadores compararão o tempo médio (em minutos) que os participantes gastam em cada caso nos dois braços de estudo.
|
Através da conclusão do estudo, uma média de 6 meses
|
|
Frequência imediata
Prazo: Através da conclusão do estudo, uma média de 6 meses
|
Os investigadores compararão a frequência dos avisos do participante com o modelo GPT-4 personalizado entre os dois grupos de estudo.
|
Através da conclusão do estudo, uma média de 6 meses
|
|
Sentimento
Prazo: Através da conclusão do estudo, uma média de 6 meses
|
Os investigadores compararão o tom e o sentimento dos avisos dos participantes com o modelo GPT-4 personalizado nos dois grupos de estudo.
Os investigadores criarão um sistema de codificação qualitativo para categorizar a natureza dos avisos dos participantes.
|
Através da conclusão do estudo, uma média de 6 meses
|
|
Percepções dos participantes da IA no raciocínio clínico
Prazo: Através da conclusão do estudo, uma média de 6 meses
|
Esse resultado seria avaliado em ambos os braços de estudo e abrangeria mudanças nas atitudes, confiança e vontade de usar ferramentas de diagnóstico de IA antes e depois de serem expostas à ferramenta personalizada.
We will assess the number of participants who were open to using AI to help with complex clinical reasoning (pre- and post-quiz), if they enjoyed working with the AI diagnostic tool, if they felt like the tool provided a valuable collaborative experience for clinical reasoning, if seeing the AI diagnostic tool's recommendations increased their confidence in their differential diagnoses, and if they would use an AI diagnostic tool like the one in this study in their daily job.
Estes serão avaliados em uma escala Likert, de discordar fortemente para concordar fortemente.
|
Através da conclusão do estudo, uma média de 6 meses
|
|
Raciocínio de diagnóstico do GPT-4 personalizado
Prazo: Através da conclusão do estudo, uma média de 6 meses
|
Os diagnósticos 'independentes' do GPT-4 personalizados serão avaliados quanto à precisão.
O resultado será a porcentagem de respostas corretas por caso (intervalo: 0 a 100).
Para cada caso, o meta-promoção direciona o GPT-4 personalizado para fornecer seus três principais diagnósticos diferenciais, além de apoiar e opostos achados para cada um, um diagnóstico final e as próximas etapas.
O GPT-4 personalizado receberá 1 ponto para cada diagnóstico plausível.
As descobertas de apoio e opostas serão classificadas com base na correção, com 1 ponto para uma resposta parcialmente correta e 2 pontos para uma resposta completamente correta.
Seu diagnóstico principal ganhará 1 ponto por uma escolha razoável e 2 pontos para o diagnóstico mais preciso.
Finalmente, ele listará até três próximas etapas para avaliação adicional do paciente, com 1 ponto concedido por uma resposta parcialmente correta e 2 pontos para uma resposta completamente correta.
O resultado será analisado no nível do caso, comparando o desempenho com as pontuações randomizadas dos grupos de estudo.
|
Através da conclusão do estudo, uma média de 6 meses
|
Colaboradores e Investigadores
Patrocinador
Colaboradores
Investigadores
- Investigador principal: Jonathan H Chen, MD, PhD, Stanford University
Datas de registro do estudo
Datas Principais do Estudo
Início do estudo (Real)
Conclusão Primária (Real)
Conclusão do estudo (Real)
Datas de inscrição no estudo
Enviado pela primeira vez
Enviado pela primeira vez que atendeu aos critérios de CQ
Primeira postagem (Real)
Atualizações de registro de estudo
Última Atualização Postada (Real)
Última atualização enviada que atendeu aos critérios de controle de qualidade
Última verificação
Mais Informações
Termos relacionados a este estudo
Termos MeSH relevantes adicionais
Outros números de identificação do estudo
- 71319c
Plano para dados de participantes individuais (IPD)
Planeja compartilhar dados de participantes individuais (IPD)?
Informações sobre medicamentos e dispositivos, documentos de estudo
Estuda um medicamento regulamentado pela FDA dos EUA
Estuda um produto de dispositivo regulamentado pela FDA dos EUA
produto fabricado e exportado dos EUA
Essas informações foram obtidas diretamente do site clinicaltrials.gov sem nenhuma alteração. Se você tiver alguma solicitação para alterar, remover ou atualizar os detalhes do seu estudo, entre em contato com register@clinicaltrials.gov. Assim que uma alteração for implementada em clinicaltrials.gov, ela também será atualizada automaticamente em nosso site .