Esta página foi traduzida automaticamente e a precisão da tradução não é garantida. Por favor, consulte o versão em inglês para um texto fonte.

Raciocínio de diagnóstico com modelo GPT-4 personalizado

27 de março de 2025 atualizado por: Jonathan Chen, Stanford University

Avaliando o desempenho dos LLMs e médicos em casos de diagnóstico complexos: um estudo controlado randomizado

Este estudo avaliará o impacto do acesso imediato a uma versão personalizada do GPT-4, um grande modelo de idioma, no desempenho em tarefas de raciocínio de diagnóstico baseadas em casos. Especificamente, ele comparará essa abordagem com um processo de duas etapas, onde os participantes primeiro usam ferramentas tradicionais de suporte à decisão de diagnóstico para apoiar seu raciocínio diagnóstico antes de obter acesso ao modelo GPT-4 personalizado.

Visão geral do estudo

Descrição detalhada

As tecnologias de inteligência artificial (IA), particularmente modelos avançados de idiomas como o ChatGPT da OpenAI, têm o potencial de melhorar a tomada de decisões médicas. Embora o ChatGPT-4 não tenha sido projetado especificamente para aplicações médicas, ele demonstrou promessa em vários contextos de saúde, incluindo redação médica, abordando consultas de pacientes e facilitando consultas médicas. No entanto, seu impacto no raciocínio diagnóstico dos médicos permanece amplamente desconhecido.

O raciocínio clínico é um processo complexo que envolve reconhecimento de padrões, aplicação de conhecimento e raciocínio probabilístico. A integração de ferramentas de IA como ChatGPT-4 nos fluxos de trabalho médicos pode ajudar a reduzir a carga de trabalho do clínico e diminuir a probabilidade de diagnósticos perdidos. No entanto, o ChatGPT-4 não foi desenvolvido nem validado para o raciocínio de diagnóstico, e pode produzir informações enganosas, incluindo conclusões plausíveis, mas incorretas, que poderiam despertar os médicos. Se não for usado adequadamente, pode não melhorar e pode até impedir a tomada de decisões clínicas. Portanto, é essencial estudar como os médicos usam grandes modelos de linguagem para apoiar o raciocínio clínico antes de integrá -los ao atendimento de rotina do paciente.

Este estudo examinará como o acesso imediato a uma versão personalizada do ChatGPT-4 afeta o desempenho nas tarefas de raciocínio de diagnóstico baseadas em casos, em comparação com uma abordagem gradual. Na abordagem Stepwise, os participantes primeiro usarão ferramentas tradicionais de suporte à decisão de diagnóstico para apoiar o raciocínio de casos antes de interagir com um modelo CHATGPT-4 personalizado, quando terão a oportunidade de revisar suas respostas iniciais.

Os participantes serão randomizados em diferentes braços de estudo e responderão a casos de diagnóstico, fornecendo três diagnósticos diferenciais, além de apoiar e opostos achados para cada um. Eles também identificarão seu principal diagnóstico e proporão as próximas etapas de diagnóstico. Os revisores independentes, cegos para a tarefa de tratamento, avaliarão suas respostas.

Tipo de estudo

Intervencional

Inscrição (Real)

70

Estágio

  • Não aplicável

Contactos e Locais

Esta seção fornece os detalhes de contato para aqueles que conduzem o estudo e informações sobre onde este estudo está sendo realizado.

Locais de estudo

    • California
      • Palo Alto, California, Estados Unidos, 94305
        • Stanford University

Critérios de participação

Os pesquisadores procuram pessoas que se encaixem em uma determinada descrição, chamada de critérios de elegibilidade. Alguns exemplos desses critérios são a condição geral de saúde de uma pessoa ou tratamentos anteriores.

Critérios de elegibilidade

Idades elegíveis para estudo

  • Filho
  • Adulto
  • Adulto mais velho

Aceita Voluntários Saudáveis

Sim

Descrição

Critérios de inclusão:

  • Os participantes devem ser médicos licenciados e completarem pelo menos o ano 1 de pós-graduação (PGY1) de treinamento médico.
  • Treinamento em medicina interna, medicina de família ou medicina de emergência.

Critérios de exclusão:

  • Atualmente não está praticando clinicamente.
  • Participou de um de nossos estudos anteriores que usaram os mesmos seis casos de diagnóstico.

Plano de estudo

Esta seção fornece detalhes do plano de estudo, incluindo como o estudo é projetado e o que o estudo está medindo.

Como o estudo é projetado?

Detalhes do projeto

  • Finalidade Principal: Diagnóstico
  • Alocação: Randomizado
  • Modelo Intervencional: Atribuição Paralela
  • Mascaramento: Solteiro

Armas e Intervenções

Grupo de Participantes / Braço
Intervenção / Tratamento
Comparador Ativo: Acesso imediato à versão personalizada do GPT-4
O grupo será incentivado a usar imediatamente uma versão personalizada do GPT-4.
O grupo recebe acesso imediato a uma versão personalizada do GPT-4 para apoiar seu raciocínio diagnóstico para cada caso.
Comparador Ativo: Recursos convencionais primeiro e depois concederam acesso à versão personalizada do GPT-4.
O grupo será incentivado a usar primeiro os recursos que desejarem, além de grandes modelos de idiomas (Uptodate, PubMed, Google etc) e terá acesso a uma versão personalizada do GPT-4.
O grupo é incentivado a raciocinar por meio de casos de diagnóstico com o apoio de recursos convencionais. Depois de enviarem as respostas de um caso, eles têm acesso a uma versão personalizada do GPT-4 e têm a oportunidade de alterar suas respostas iniciais.

O que o estudo está medindo?

Medidas de resultados primários

Medida de resultado
Descrição da medida
Prazo
Raciocínio diagnóstico
Prazo: Através da conclusão do estudo, uma média de 6 meses
O desfecho primário será a porcentagem de respostas corretas por caso (intervalo: 0 a 100). Para cada caso, os participantes serão solicitados a fornecer seus três principais diagnósticos diferenciais, além de apoiar e adquirir descobertas para cada um. Eles receberão 1 ponto para cada diagnóstico plausível. As descobertas de apoio e opostas serão classificadas com base na correção, com 1 ponto para uma resposta parcialmente correta e 2 pontos para uma resposta completamente correta. Os participantes selecionarão seu principal diagnóstico, ganhando 1 ponto para uma escolha razoável e 2 pontos para o diagnóstico mais preciso. Finalmente, eles listarão até três próximas etapas para avaliação adicional do paciente, com 1 ponto concedido por uma resposta parcialmente correta e 2 pontos para uma resposta completamente correta. O desfecho primário será analisado no nível do caso, comparando o desempenho entre os grupos de estudo randomizados.
Através da conclusão do estudo, uma média de 6 meses

Medidas de resultados secundários

Medida de resultado
Descrição da medida
Prazo
Tempo gasto por caso
Prazo: Através da conclusão do estudo, uma média de 6 meses
Os investigadores compararão o tempo médio (em minutos) que os participantes gastam em cada caso nos dois braços de estudo.
Através da conclusão do estudo, uma média de 6 meses
Frequência imediata
Prazo: Através da conclusão do estudo, uma média de 6 meses
Os investigadores compararão a frequência dos avisos do participante com o modelo GPT-4 personalizado entre os dois grupos de estudo.
Através da conclusão do estudo, uma média de 6 meses
Sentimento
Prazo: Através da conclusão do estudo, uma média de 6 meses
Os investigadores compararão o tom e o sentimento dos avisos dos participantes com o modelo GPT-4 personalizado nos dois grupos de estudo. Os investigadores criarão um sistema de codificação qualitativo para categorizar a natureza dos avisos dos participantes.
Através da conclusão do estudo, uma média de 6 meses
Percepções dos participantes da IA ​​no raciocínio clínico
Prazo: Através da conclusão do estudo, uma média de 6 meses
Esse resultado seria avaliado em ambos os braços de estudo e abrangeria mudanças nas atitudes, confiança e vontade de usar ferramentas de diagnóstico de IA antes e depois de serem expostas à ferramenta personalizada. We will assess the number of participants who were open to using AI to help with complex clinical reasoning (pre- and post-quiz), if they enjoyed working with the AI ​​diagnostic tool, if they felt like the tool provided a valuable collaborative experience for clinical reasoning, if seeing the AI ​​diagnostic tool's recommendations increased their confidence in their differential diagnoses, and if they would use an AI diagnostic tool like the one in this study in their daily job. Estes serão avaliados em uma escala Likert, de discordar fortemente para concordar fortemente.
Através da conclusão do estudo, uma média de 6 meses
Raciocínio de diagnóstico do GPT-4 personalizado
Prazo: Através da conclusão do estudo, uma média de 6 meses
Os diagnósticos 'independentes' do GPT-4 personalizados serão avaliados quanto à precisão. O resultado será a porcentagem de respostas corretas por caso (intervalo: 0 a 100). Para cada caso, o meta-promoção direciona o GPT-4 personalizado para fornecer seus três principais diagnósticos diferenciais, além de apoiar e opostos achados para cada um, um diagnóstico final e as próximas etapas. O GPT-4 personalizado receberá 1 ponto para cada diagnóstico plausível. As descobertas de apoio e opostas serão classificadas com base na correção, com 1 ponto para uma resposta parcialmente correta e 2 pontos para uma resposta completamente correta. Seu diagnóstico principal ganhará 1 ponto por uma escolha razoável e 2 pontos para o diagnóstico mais preciso. Finalmente, ele listará até três próximas etapas para avaliação adicional do paciente, com 1 ponto concedido por uma resposta parcialmente correta e 2 pontos para uma resposta completamente correta. O resultado será analisado no nível do caso, comparando o desempenho com as pontuações randomizadas dos grupos de estudo.
Através da conclusão do estudo, uma média de 6 meses

Colaboradores e Investigadores

É aqui que você encontrará pessoas e organizações envolvidas com este estudo.

Patrocinador

Investigadores

  • Investigador principal: Jonathan H Chen, MD, PhD, Stanford University

Datas de registro do estudo

Essas datas acompanham o progresso do registro do estudo e os envios de resumo dos resultados para ClinicalTrials.gov. Os registros do estudo e os resultados relatados são revisados ​​pela National Library of Medicine (NLM) para garantir que atendam aos padrões específicos de controle de qualidade antes de serem publicados no site público.

Datas Principais do Estudo

Início do estudo (Real)

16 de dezembro de 2024

Conclusão Primária (Real)

24 de janeiro de 2025

Conclusão do estudo (Real)

24 de janeiro de 2025

Datas de inscrição no estudo

Enviado pela primeira vez

11 de fevereiro de 2025

Enviado pela primeira vez que atendeu aos critérios de CQ

27 de março de 2025

Primeira postagem (Real)

4 de abril de 2025

Atualizações de registro de estudo

Última Atualização Postada (Real)

4 de abril de 2025

Última atualização enviada que atendeu aos critérios de controle de qualidade

27 de março de 2025

Última verificação

1 de março de 2025

Mais Informações

Termos relacionados a este estudo

Termos MeSH relevantes adicionais

Outros números de identificação do estudo

  • 71319c

Plano para dados de participantes individuais (IPD)

Planeja compartilhar dados de participantes individuais (IPD)?

NÃO

Informações sobre medicamentos e dispositivos, documentos de estudo

Estuda um medicamento regulamentado pela FDA dos EUA

Não

Estuda um produto de dispositivo regulamentado pela FDA dos EUA

Não

produto fabricado e exportado dos EUA

Não

Essas informações foram obtidas diretamente do site clinicaltrials.gov sem nenhuma alteração. Se você tiver alguma solicitação para alterar, remover ou atualizar os detalhes do seu estudo, entre em contato com register@clinicaltrials.gov. Assim que uma alteração for implementada em clinicaltrials.gov, ela também será atualizada automaticamente em nosso site .

Se inscrever