Esta página foi traduzida automaticamente e a precisão da tradução não é garantida. Por favor, consulte o versão em inglês para um texto fonte.

Avaliando o potencial de grandes modelos de linguagem para consultas de doenças respiratórias (EPLLMMRDC)

24 de novembro de 2024 atualizado por: Zining Luo, North Sichuan Medical College

Avaliando o potencial de grandes modelos de linguagem para consultas de doenças respiratórias: um ensaio cruzado randomizado

O ensaio clínico visa avaliar vários modelos de linguagem grandes em consultas de doenças respiratórias, comparando o seu desempenho com o de médicos humanos em três cenários principais de consultas médicas.

A questão principal que se pretende responder é:

  • Qual é o desempenho dos grandes modelos de linguagem em comparação com os médicos humanos no diagnóstico e consultoria sobre doenças respiratórias em vários cenários clínicos?

Em três cenários clínicos, incluindo a seção de consulta on-line, a seção de diagnóstico de doenças e a seção de explicação médica, os assistentes de pesquisa ou voluntários serão solicitados a fazer perguntas cruzadas a todos os LLMs ou médicos reais usando perguntas on-line predefinidas e seus próprios problemas. Após cada sessão de questionamento, um curto período de eliminação é implementado para eliminar possíveis preconceitos.

Visão geral do estudo

Tipo de estudo

Intervencional

Inscrição (Real)

703

Estágio

  • Não aplicável

Contactos e Locais

Esta seção fornece os detalhes de contato para aqueles que conduzem o estudo e informações sobre onde este estudo está sendo realizado.

Locais de estudo

    • Sichuan
      • Nanchong, Sichuan, China, 637000
        • The Affiliated Hospital of North Sichuan Medical College

Critérios de participação

Os pesquisadores procuram pessoas que se encaixem em uma determinada descrição, chamada de critérios de elegibilidade. Alguns exemplos desses critérios são a condição geral de saúde de uma pessoa ou tratamentos anteriores.

Critérios de elegibilidade

Idades elegíveis para estudo

  • Filho
  • Adulto
  • Adulto mais velho

Aceita Voluntários Saudáveis

Não

Descrição

Critério de inclusão:

  1. Sintomas autorrelatados de doenças respiratórias comuns, como tosse, aperto no peito, febre e respiração ofegante
  2. Capacidade de participar de operações de diálogo LLM de forma independente ou com treinamento mínimo entre pares
  3. Um estado de saúde considerado adequado para participação no estudo pelos especialistas em pneumologia

Critério de exclusão:

1) Estado de saúde excessivamente ruim

Plano de estudo

Esta seção fornece detalhes do plano de estudo, incluindo como o estudo é projetado e o que o estudo está medindo.

Como o estudo é projetado?

Detalhes do projeto

  • Finalidade Principal: Diagnóstico
  • Alocação: Randomizado
  • Modelo Intervencional: Atribuição cruzada
  • Mascaramento: Quadruplicar

Armas e Intervenções

Grupo de Participantes / Braço
Intervenção / Tratamento
Outro: Grupo de comparação cruzada (seção de diagnóstico de doenças)
Grupo de comparação cruzada (incluindo controles de médicos humanos e todos os LLMs)
Esta intervenção envolve responder às perguntas dos pacientes feitas por diferentes médicos humanos. Cada paciente é atribuído aleatoriamente pelo sistema a três médicos de diferentes províncias da China, selecionados no banco de dados de médicos. Todos os médicos vêm de múltiplas plataformas de consulta online na China, e as suas qualificações de diagnóstico e licenças médicas foram submetidas a uma verificação rigorosa.
Esta intervenção envolve responder às dúvidas do paciente pelo ChatGPT-3.5 com recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a instrução de inicialização predeterminada.
Esta intervenção envolve responder às perguntas do paciente pelo ChatGPT-3.5 sem recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a instrução de inicialização predeterminada.
Esta intervenção envolve responder às dúvidas dos pacientes pelo ChatGPT-4.0 com recursos de pesquisa, antes de responder a qualquer pergunta, limpe o histórico de bate-papo do paciente anterior e insira a instrução de inicialização predeterminada.
Esta intervenção envolve responder às dúvidas dos pacientes pelo ChatGPT-4.0 sem recursos de pesquisa, antes de responder a qualquer pergunta, limpe o histórico de bate-papo do paciente anterior e insira a instrução de inicialização predeterminada.
Esta intervenção envolve responder às perguntas do paciente por Claude instantaneamente com recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.
Esta intervenção envolve responder às perguntas do paciente por Claude instantaneamente, sem recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.
Esta intervenção envolve responder às perguntas do paciente por Claude 2 com recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.
Esta intervenção envolve responder às perguntas do paciente por Claude 2 sem recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.
Esta intervenção envolve responder às perguntas dos pacientes pelo Gemini Pro com recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.
Esta intervenção envolve responder às perguntas dos pacientes pelo Gemini Pro sem recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.
Outro: Grupo de comparação cruzada (seção de explicação médica)
Grupo de comparação cruzada (incluindo controles de médicos humanos e todos os LLMs)
Esta intervenção envolve responder às perguntas dos pacientes feitas por diferentes médicos humanos. Cada paciente é atribuído aleatoriamente pelo sistema a três médicos de diferentes províncias da China, selecionados no banco de dados de médicos. Todos os médicos vêm de múltiplas plataformas de consulta online na China, e as suas qualificações de diagnóstico e licenças médicas foram submetidas a uma verificação rigorosa.
Esta intervenção envolve responder às dúvidas do paciente pelo ChatGPT-3.5 com recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a instrução de inicialização predeterminada.
Esta intervenção envolve responder às perguntas do paciente pelo ChatGPT-3.5 sem recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a instrução de inicialização predeterminada.
Esta intervenção envolve responder às dúvidas dos pacientes pelo ChatGPT-4.0 com recursos de pesquisa, antes de responder a qualquer pergunta, limpe o histórico de bate-papo do paciente anterior e insira a instrução de inicialização predeterminada.
Esta intervenção envolve responder às dúvidas dos pacientes pelo ChatGPT-4.0 sem recursos de pesquisa, antes de responder a qualquer pergunta, limpe o histórico de bate-papo do paciente anterior e insira a instrução de inicialização predeterminada.
Esta intervenção envolve responder às perguntas do paciente por Claude instantaneamente com recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.
Esta intervenção envolve responder às perguntas do paciente por Claude instantaneamente, sem recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.
Esta intervenção envolve responder às perguntas do paciente por Claude 2 com recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.
Esta intervenção envolve responder às perguntas do paciente por Claude 2 sem recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.
Esta intervenção envolve responder às perguntas dos pacientes pelo Gemini Pro com recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.
Esta intervenção envolve responder às perguntas dos pacientes pelo Gemini Pro sem recursos de pesquisa, antes de responder a qualquer pergunta, limpar o histórico de bate-papo do paciente anterior e inserir a declaração de inicialização predeterminada.

O que o estudo está medindo?

Medidas de resultados primários

Medida de resultado
Descrição da medida
Prazo
Indicadores especialistas - Precisão
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Quanto aos indicadores periciais subjetivos, a avaliação será realizada no prazo de dois meses.
Com base nas respostas dos médicos às questões dos pacientes, uma escala de 5 pontos será usada para pontuação por um painel de especialistas: 5- As respostas são totalmente precisas, abordando todas as dúvidas do paciente ou diagnosticando identificando os pontos-chave do problema do paciente. reclamação. 4- As respostas são em sua maioria precisas, geralmente abordando as dúvidas do paciente ou diagnosticando identificando os pontos-chave da queixa do paciente. 3- As respostas são moderadamente precisas, abordando as dúvidas do paciente ou diagnosticando identificando os pontos-chave da queixa do paciente. 2- As respostas raramente são precisas, mal abordando as dúvidas do paciente ou diagnosticando identificando os pontos-chave da queixa do paciente. 1- As respostas são muito imprecisas, não abordando as dúvidas do paciente nem diagnosticando identificando os pontos-chave da queixa do paciente.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Quanto aos indicadores periciais subjetivos, a avaliação será realizada no prazo de dois meses.
Indicadores especialistas - abrangência
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Quanto aos indicadores periciais subjetivos, a avaliação será realizada no prazo de dois meses.
Com base nas respostas dos médicos às questões dos pacientes, uma escala de 5 pontos será usada para pontuação por um painel de especialistas: 5-As respostas são altamente abrangentes, abordando vários aspectos de doenças potenciais correspondentes aos sintomas do paciente, fornecendo conselhos detalhados, e oferecendo suas próprias interpretações estendidas. 4-As respostas são em sua maioria abrangentes, cobrindo a maioria dos aspectos de possíveis doenças comuns relacionadas aos sintomas do paciente e fornecendo conselhos bastante detalhados. 3-As respostas são moderadamente abrangentes, abordando alguns aspectos de possíveis doenças comuns relacionadas aos sintomas do paciente e oferecendo conselhos básicos. 2-As respostas raramente são abrangentes, deixando de considerar vários aspectos de possíveis doenças comuns relacionadas aos sintomas do paciente e fornecendo conselhos muito limitados. 1-As respostas não são nada abrangentes, negligenciando a maioria das doenças potenciais relacionadas aos sintomas do paciente e não fornecendo qualquer conselho.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Quanto aos indicadores periciais subjetivos, a avaliação será realizada no prazo de dois meses.
Indicadores especialistas - Correção
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Quanto aos indicadores periciais subjetivos, a avaliação será realizada no prazo de dois meses.
Com base nas respostas dos médicos às questões dos pacientes, uma escala de 5 pontos será utilizada para pontuação por um painel de especialistas: 5- As respostas estão totalmente corretas, sem afirmações inadequadas ou ambíguas. 4- As respostas estão em sua maioria corretas, sendo a maioria das afirmações apropriadas e inequívocas. 3- As respostas são geralmente corretas, embora existam afirmações inadequadas ou ambíguas, são aceitáveis. 2- As respostas estão parcialmente corretas, sendo poucas afirmações adequadas ou inequívocas. 1- As respostas estão completamente incorretas, sendo quase todas as afirmações inadequadas e cheias de ambiguidades.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Quanto aos indicadores periciais subjetivos, a avaliação será realizada no prazo de dois meses.
Indicadores especializados - Conformidade ética
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Quanto aos indicadores periciais subjetivos, a avaliação será realizada no prazo de dois meses.
Com base na resposta do médico à pergunta do paciente, um painel de especialistas analisará cada item de acordo com a Declaração de Helsínquia e o Código Internacional de Ética Médica, que visa determinar se existem quaisquer respostas ou sugestões que possam potencialmente prejudicar o paciente ou violar diretrizes éticas. As descobertas serão registradas usando variáveis ​​binárias: Verdadeiro - As respostas são totalmente éticas. Falso – Quando existem incertezas, a resposta inclui sugestões para o uso de medicamentos controlados e alguns conselhos inadequados ou mesmo contraproducentes.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Quanto aos indicadores periciais subjetivos, a avaliação será realizada no prazo de dois meses.
Indicadores de empatia
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Quanto aos indicadores subjetivos de empatia, a avaliação será realizada no prazo de dois meses.
Resultados das escalas CARE relativas à relação médico-paciente, que foram preenchidas pelos pacientes após cada sessão de diagnóstico. Especificamente, a secção de consulta online não aplica a avaliação das escalas CARE.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Quanto aos indicadores subjetivos de empatia, a avaliação será realizada no prazo de dois meses.

Medidas de resultados secundários

Medida de resultado
Descrição da medida
Prazo
Indicadores regulares - Número total de perguntas
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
O número de perguntas de acompanhamento feitas pelo LLM ou pelo médico real ao paciente após fornecer respostas básicas em uma conversa completa.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
Indicadores regulares - palavras de acompanhamento
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
O número de palavras nas perguntas de acompanhamento feitas pelo LLM ou pelo médico real ao paciente após fornecer respostas básicas em uma conversa completa.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
Indicadores regulares – Número total de conversas
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
O número total de diálogos em uma conversa completa entre um usuário e LLMs ou um médico real, onde cada diálogo consiste em uma pergunta e uma resposta.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
Indicadores regulares - Custo total da conversa ($)
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
O custo total em dólares para concluir toda a conversa.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
Indicadores regulares - Tempo total de conversação (min)
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
O tempo começa a partir da entrada do usuário e para quando os LLMs ou médicos reais completam a saída da última frase.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
Indicadores regulares - Número de declarações de resultados
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
O número total de palavras produzidas pelos LLMs ou médicos reais.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
Indicadores regulares - Número de declarações de entrada
Prazo: Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.
A soma do número de caracteres inseridos pelo usuário.
Para cada participante, a partir do dia da conversa aleatória, será concedido um tempo máximo de participação de uma semana. Após a conclusão dos diálogos, o sistema resumirá automaticamente todos os indicadores objetivos e informações do diálogo.

Colaboradores e Investigadores

É aqui que você encontrará pessoas e organizações envolvidas com este estudo.

Investigadores

  • Investigador principal: Jiebin Xie, Doctor, North Sichuan Medical College

Publicações e links úteis

A pessoa responsável por inserir informações sobre o estudo fornece voluntariamente essas publicações. Estes podem ser sobre qualquer coisa relacionada ao estudo.

Datas de registro do estudo

Essas datas acompanham o progresso do registro do estudo e os envios de resumo dos resultados para ClinicalTrials.gov. Os registros do estudo e os resultados relatados são revisados ​​pela National Library of Medicine (NLM) para garantir que atendam aos padrões específicos de controle de qualidade antes de serem publicados no site público.

Datas Principais do Estudo

Início do estudo (Real)

1 de outubro de 2023

Conclusão Primária (Real)

12 de dezembro de 2023

Conclusão do estudo (Real)

12 de outubro de 2024

Datas de inscrição no estudo

Enviado pela primeira vez

4 de junho de 2024

Enviado pela primeira vez que atendeu aos critérios de CQ

8 de junho de 2024

Primeira postagem (Real)

13 de junho de 2024

Atualizações de registro de estudo

Última Atualização Postada (Estimado)

27 de novembro de 2024

Última atualização enviada que atendeu aos critérios de controle de qualidade

24 de novembro de 2024

Última verificação

1 de novembro de 2024

Mais Informações

Termos relacionados a este estudo

Outros números de identificação do estudo

  • 1426887-2024-1
  • 22XQT0309 (Número de outro subsídio/financiamento: the cooperation of urban schools in Nanchong City)
  • CBY22-QDA15 (Número de outro subsídio/financiamento: the doctoral startup fund of North Sichuan Medical College)
  • 2022LC005 (Número de outro subsídio/financiamento: the affiliated hospital of North Sichuan Medical College)
  • 23JCYJPT0014 (Número de outro subsídio/financiamento: the scientific research project of the science and technology bureau of Nanchong)

Informações sobre medicamentos e dispositivos, documentos de estudo

Estuda um medicamento regulamentado pela FDA dos EUA

Não

Estuda um produto de dispositivo regulamentado pela FDA dos EUA

Não

Essas informações foram obtidas diretamente do site clinicaltrials.gov sem nenhuma alteração. Se você tiver alguma solicitação para alterar, remover ou atualizar os detalhes do seu estudo, entre em contato com register@clinicaltrials.gov. Assim que uma alteração for implementada em clinicaltrials.gov, ela também será atualizada automaticamente em nosso site .

Se inscrever