Esta página foi traduzida automaticamente e a precisão da tradução não é garantida. Por favor, consulte o versão em inglês para um texto fonte.

Desenvolvimento de uma ferramenta de processamento de linguagem natural para possibilitar pesquisas clínicas em medicina de emergência (NLP-DeVal)

14 de julho de 2026 atualizado por: Mario Negri Institute for Pharmacological Research

Desenvolvimento e validação de uma ferramenta de processamento de linguagem natural para permitir pesquisas clínicas em medicina de emergência e cuidados agudos: estudo de coorte retrospectivo

O objetivo deste estudo de coorte retrospectivo é desenvolver e validar um modelo de linguagem que possa interpretar o conteúdo dos registros médicos eletrônicos do departamento de emergência e extrair informações relevantes para fins de pesquisa em todos os pacientes adultos que chegaram aos departamentos de emergência participantes em um período de três anos. .

A principal questão que se pretende responder é: o modelo de linguagem é capaz de interpretar o conteúdo dos prontuários eletrônicos do pronto-socorro e extrair deles as informações solicitadas para que possam ser utilizadas para fazer análises e previsões precisas?

O estudo é retrospectivo e os dados serão extraídos automaticamente dos prontuários médicos.

Visão geral do estudo

Status

Recrutamento

Intervenção / Tratamento

Descrição detalhada

ANTECEDENTES E JUSTIFICATIVA DO ESTUDO

A realização de pesquisas de avaliação clínica e de qualidade de atendimento em medicina de emergência é tão difícil quanto importante. É difícil porque o grande número de pacientes que precisam de ser tratados e a escassez crónica de pessoal tornam impraticável a recolha de dados ad hoc. É importante porque, em última análise, a investigação permite que médicos e enfermeiros de emergência baseiem a sua prática em evidências obtidas no seu próprio e único ambiente, em oposição a evidências obtidas em contextos distantes, como é habitualmente o caso hoje em dia.

A única forma de colmatar a lacuna entre as necessidades de investigação e a disponibilidade de dados robustos é extrair dados diretamente dos registos de saúde eletrónicos (EHR) dos serviços de emergência, evitando a recolha de dados dedicada e demorada. Esta é uma tarefa difícil, no entanto, porque a informação mais útil está em formato de texto livre (por exemplo, presença de sinais e sintomas, diagnóstico suspeito e confirmado, anamnese). Tais circunstâncias e necessidades exigem uma ferramenta confiável de processamento de linguagem natural (PNL) para obter dados altamente consistentes de texto livre.

Hoje, estão disponíveis modelos de linguagem em larga escala que podem interpretar com precisão a linguagem natural. No entanto, estes modelos são treinados com base em enormes quantidades de conhecimento geral obtido principalmente da Internet, pelo que o seu desempenho em áreas mais especializadas, como o domínio médico, pode não ser o ideal.

O presente estudo faz parte de um projeto maior denominado eCREAM (permitindo Pesquisa Clínica em Medicina de Emergência e Cuidados Agudos), e tem como objetivo desenvolver e validar um modelo de linguagem (denominado eCREAM_LM) ​​para seis idiomas que possa interpretar o conteúdo dos EHRs do departamento de emergência e extrair informações relevantes para fins de pesquisa.

MÉTODOS

O estudo é um estudo observacional, multicêntrico, retrospectivo, de 24 meses. Participarão no estudo trinta centros: 13 de Itália, 4 da Polónia, 3 da Grécia, Eslováquia, Eslovénia e Reino Unido e 1 da Suíça. Os centros não receberão qualquer compensação, mas as suas despesas serão cobertas pelos fundos do projecto.

Desenvolvimento e validação do modelo eCREAM_LM.

O eCREAM_LM será desenvolvido através de treinamento e ajuste fino do melhor modelo geral, entre aqueles de código aberto, e prosseguirá em fases parcialmente paralelas. Os modelos candidatos serão expostos a uma enorme quantidade (bilhões) de textos médicos da literatura científica ou de outras fontes públicas. Simultaneamente, os modelos também serão expostos a uma enorme quantidade (milhões) de notas de texto livre obtidas de registros médicos em uso nos hospitais participantes. Passaremos então ao ajuste fino, onde será utilizada uma grande quantidade (milhares) de notas clínicas, obtidas, mais uma vez, dos prontuários dos centros participantes. Essas anotações serão anotadas por médicos experientes, o que consiste em extrair informações das anotações para preencher os itens de dados listados em um formulário virtual de coleta de dados (vCRF). O vCRF foi criado para um estudo relacionado e contém um conjunto de variáveis ​​úteis na predição da hospitalização de pacientes com dispneia ou perda transitória de consciência, que é o objetivo do estudo relacionado. No presente estudo, o vCRF servirá como ferramenta de validação do modelo de linguagem.

A validação do eCREAM_LM será realizada através de um conjunto de 1.000 notas clínicas anotadas conforme descrito acima, mas não utilizadas na fase de desenvolvimento. Estas notas serão submetidas ao modelo eCREAM_LM com a tarefa de compilar o vCRF. A concordância no preenchimento do vCRF entre os médicos especialistas e o eCREAM_LM será a medida de validação final do eCREAM_LM.

Coleta de dados e anonimização

Cada hospital participante fornecerá notas de texto gratuitas contidas nos registros médicos de 150 a 300 mil pacientes adultos tratados entre 2021 e 2023. As notas referentes a diferentes aspectos do mesmo paciente (por exemplo, história, exame objetivo, resultados de exames) serão separadas umas das outras de modo que será impossível reconstruir o perfil completo do paciente. Além disso, as anotações serão despojadas de qualquer referência ao paciente (por exemplo, nome, sobrenome, data de nascimento) e contexto (por exemplo, hospital, data e hora de chegada ao centro). Este processo minimiza a probabilidade de reidentificação dos pacientes e maximiza a proteção dos seus direitos. A probabilidade de reidentificar um paciente em um banco de dados depende de quão únicas são suas características em relação a outros indivíduos no banco de dados. A probabilidade de ter pacientes únicos e, portanto, identificáveis, aumenta com a quantidade de informação disponível na base de dados e diminui com o seu tamanho. Ao retirar todas as informações pessoais e contextuais das notas clínicas e separar cada nota das demais, cada nota relatará apenas algumas características do paciente. Além disso, os dados recolhidos em hospitais do mesmo país serão fundidos para que haja uma grande base de dados para cada idioma. Isso efetivamente zera a probabilidade de haver indivíduos identificáveis ​​exclusivamente nas notas.

Por fim, para descartar a possibilidade de as notas conterem informações sobre terceiros, como nomes e números de telefone de familiares de pacientes, será instalado em cada hospital um software de anonimato certificado, projetado especificamente para remover dados pessoais de texto livre.

Uma vez anonimizados, os dados serão centralizados para análise e também serão carregados nas principais plataformas europeias de partilha de recursos linguísticos na comunidade científica.

Análise estatística

Na validação do eCREAM_LM avaliaremos a concordância entre médicos especialistas em emergência e o próprio eCREAM_LM no preenchimento do vCRF. Os dados serão referentes a uma amostra de 1.000 notas para cada idioma de estudo. A concordância será avaliada para cada variável do vCRF usando κ de Cohen como medida de concordância. O eCREAM_LM será considerado válido se o κ de Cohen for maior que 0,75.

Tamanho da amostra

Assumindo uma concordância excelente (κ=0,80) entre o eCREAM_LM e os médicos de emergência experientes no preenchimento do vCRF, será necessária uma amostra de pelo menos 735 notas para alcançar precisão suficiente para garantir uma boa concordância (limite de confiança inferior de intervalo de confiança de 95% de κ de Cohen maior que 0,75). Este número é o tamanho máximo da amostra obtido em diferentes cenários envolvendo um número diferente de categorias (2 a 5) para cada variável e diferentes distribuições marginais das categorias na amostra, incluindo distribuições equilibradas (por exemplo, 5 categorias com 20% da amostra em cada categoria) e resultados muito desequilibrados (e.g., 5 categorias com 1,8%, 7,3%, 16,4%, 29,1% e 45,5% da amostra). Como podem faltar informações de interesse em algumas notas, realizaremos a avaliação de validação de dados em 1.000 notas.

Tipo de estudo

Observacional

Inscrição (Estimado)

300000

Contactos e Locais

Esta seção fornece os detalhes de contato para aqueles que conduzem o estudo e informações sobre onde este estudo está sendo realizado.

Contato de estudo

Estude backup de contato

Locais de estudo

      • Catania, Itália
        • Ainda não está recrutando
        • AOU Policlinico 'G.Rodolico - San Marco'
        • Contato:
      • Milan, Itália
      • Milan, Itália
        • Ainda não está recrutando
        • ASST Grande Ospedale Metropolitano Niguarda
        • Contato:
      • Orbassano, Itália
        • Ainda não está recrutando
        • Ospedale San Luigi Gonzaga
        • Contato:
          • Valeria Caramello
          • Número de telefone: v.caramello@sa +39 011 90261
      • Pozzuoli, Itália
        • Ainda não está recrutando
        • Ospedale Santa Maria delle Grazie
        • Contato:
      • Torino, Itália
      • Vercelli, Itália
        • Recrutamento
        • Ospedale Sant'Andrea
        • Contato:
    • Milan
      • Milan, Milan, Itália, 20156
        • Ainda não está recrutando
        • Istituto di Ricerche Farmacologiche Mario Negri IRCCS
        • Contato:

Critérios de participação

Os pesquisadores procuram pessoas que se encaixem em uma determinada descrição, chamada de critérios de elegibilidade. Alguns exemplos desses critérios são a condição geral de saúde de uma pessoa ou tratamentos anteriores.

Critérios de elegibilidade

Idades elegíveis para estudo

  • Adulto
  • Adulto mais velho

Aceita Voluntários Saudáveis

Sim

Método de amostragem

Amostra de Probabilidade

População do estudo

Todos os pacientes adultos que chegaram aos serviços de emergência participantes entre 1º de janeiro de 2021 e 31 de dezembro de 2023

Descrição

Critério de inclusão:

  • Adulto
  • Chegou ao serviço de urgência entre 1 de janeiro de 2021 e 31 de dezembro de 2023

Critério de exclusão:

  • Nenhum

Plano de estudo

Esta seção fornece detalhes do plano de estudo, incluindo como o estudo é projetado e o que o estudo está medindo.

Como o estudo é projetado?

Detalhes do projeto

Coortes e Intervenções

Grupo / Coorte
Intervenção / Tratamento
Adultos que compareceram ao pronto-socorro
nenhuma intervenção

O que o estudo está medindo?

Medidas de resultados primários

Medida de resultado
Descrição da medida
Prazo
Concordância no preenchimento do formulário virtual de relato de caso
Prazo: 1 mês
Nível de concordância no preenchimento do formulário virtual de relato de caso entre os médicos especialistas e o modelo de linguagem eCREAM_LM
1 mês

Colaboradores e Investigadores

É aqui que você encontrará pessoas e organizações envolvidas com este estudo.

Investigadores

  • Investigador principal: Guido Bertolini, Istituto Di Ricerche Farmacologiche Mario Negri

Datas de registro do estudo

Essas datas acompanham o progresso do registro do estudo e os envios de resumo dos resultados para ClinicalTrials.gov. Os registros do estudo e os resultados relatados são revisados ​​pela National Library of Medicine (NLM) para garantir que atendam aos padrões específicos de controle de qualidade antes de serem publicados no site público.

Datas Principais do Estudo

Início do estudo (Real)

1 de outubro de 2024

Conclusão Primária (Estimado)

1 de janeiro de 2027

Conclusão do estudo (Estimado)

1 de setembro de 2027

Datas de inscrição no estudo

Enviado pela primeira vez

26 de janeiro de 2024

Enviado pela primeira vez que atendeu aos critérios de CQ

26 de janeiro de 2024

Primeira postagem (Real)

5 de fevereiro de 2024

Atualizações de registro de estudo

Última Atualização Postada (Real)

15 de julho de 2026

Última atualização enviada que atendeu aos critérios de controle de qualidade

14 de julho de 2026

Última verificação

1 de julho de 2026

Mais Informações

Termos relacionados a este estudo

Termos MeSH relevantes adicionais

Outros números de identificação do estudo

  • 8780

Plano para dados de participantes individuais (IPD)

Planeja compartilhar dados de participantes individuais (IPD)?

SIM

Descrição do plano IPD

Os dados anonimizados dos participantes individuais serão carregados nas principais plataformas europeias de partilha de recursos linguísticos na comunidade científica, incluindo o repositório European Language Grid (https://live.europeanlanguage-grid.eu), o Observatório Virtual de Línguas CLARIN (https: //vlo.clarin.eu/?2) e a iniciativa European Language Equality (ELE) (https://european-language-equality.eu).

Prazo de Compartilhamento de IPD

A partir de dezembro de 2025

Tipo de informação de suporte de compartilhamento de IPD

  • PROTOCOLO DE ESTUDO
  • CSR

Informações sobre medicamentos e dispositivos, documentos de estudo

Estuda um medicamento regulamentado pela FDA dos EUA

Não

Estuda um produto de dispositivo regulamentado pela FDA dos EUA

Não

produto fabricado e exportado dos EUA

Não

Essas informações foram obtidas diretamente do site clinicaltrials.gov sem nenhuma alteração. Se você tiver alguma solicitação para alterar, remover ou atualizar os detalhes do seu estudo, entre em contato com register@clinicaltrials.gov. Assim que uma alteração for implementada em clinicaltrials.gov, ela também será atualizada automaticamente em nosso site .

Se inscrever