Cette page a été traduite automatiquement et l'exactitude de la traduction n'est pas garantie. Veuillez vous référer au version anglaise pour un texte source.

Développement d'un outil de traitement du langage naturel pour permettre la recherche clinique en médecine d'urgence (NLP-DeVal)

Développement et validation d'un outil de traitement du langage naturel pour permettre la recherche clinique en médecine d'urgence et de soins aigus : étude de cohorte rétrospective

Le but de cette étude de cohorte rétrospective est de développer et de valider un modèle de langage capable d'interpréter le contenu des dossiers médicaux électroniques des services d'urgence et d'extraire des informations pertinentes à des fins de recherche chez tous les patients adultes arrivés aux services d'urgence participants au cours d'une période de trois ans. .

La principale question à laquelle il vise à répondre est la suivante : le modèle linguistique est-il capable d'interpréter le contenu des dossiers médicaux électroniques des services d'urgence et d'en extraire les informations demandées afin de pouvoir les utiliser pour effectuer des analyses et des prédictions précises ?

L'étude est rétrospective et les données seront extraites automatiquement des dossiers médicaux.

Aperçu de l'étude

Statut

Recrutement

Les conditions

Intervention / Traitement

Description détaillée

CONTEXTE ET JUSTIFICATION DE L’ÉTUDE

Mener des recherches sur l’évaluation clinique et de la qualité des soins en médecine d’urgence est aussi difficile qu’important. Cela est difficile car le grand nombre de patients à traiter et le manque chronique de personnel rendent difficile la collecte de données ponctuelles. C’est important parce qu’en fin de compte, la recherche permet aux urgentistes et aux infirmières de fonder leur pratique sur des preuves obtenues dans leur propre contexte, par opposition aux preuves obtenues dans des contextes éloignés, comme c’est généralement le cas aujourd’hui.

La seule façon de combler le fossé entre les besoins de recherche et la disponibilité de données robustes est d’extraire les données directement des dossiers de santé électroniques (DSE) des services d’urgence, évitant ainsi une collecte de données dédiée et fastidieuse. Il s’agit cependant d’une tâche difficile, car les informations les plus utiles sont sous forme de texte libre (par exemple, présence de signes et symptômes, diagnostic suspecté et confirmé, anamnèse). De telles circonstances et besoins nécessitent un outil fiable de traitement du langage naturel (NLP) pour dériver des données hautement cohérentes à partir de texte libre.

Aujourd’hui, il existe des modèles linguistiques à grande échelle capables d’interpréter avec précision le langage naturel. Ces modèles sont toutefois formés à partir d’énormes quantités de connaissances générales provenant principalement d’Internet, de sorte que leurs performances dans des domaines plus spécialisés, tels que le domaine médical, peuvent ne pas être optimales.

La présente étude fait partie d'un projet plus vaste appelé eCREAM (permettant la recherche clinique en médecine d'urgence et de soins aigus) et vise à développer et valider un modèle de langage (appelé eCREAM_LM) ​​pour six langues capables d'interpréter le contenu des DSE des services d'urgence et extraire des informations pertinentes à des fins de recherche.

MÉTHODES

L'étude est une étude observationnelle, multicentrique et rétrospective d'une durée de 24 mois. Trente centres participeront à l'étude : 13 d'Italie, 4 de Pologne, 3 de Grèce, de Slovaquie, de Slovénie et du Royaume-Uni et 1 de Suisse. Les centres ne recevront aucune compensation, mais leurs dépenses seront couvertes par les fonds du projet.

Développement et validation du modèle eCREAM_LM.

eCREAM_LM sera développé grâce à la formation et à la mise au point du meilleur modèle global, parmi ceux open source, et se déroulera en phases partiellement parallèles. Les modèles candidats seront exposés à une quantité énorme (des milliards) de textes médicaux issus de la littérature scientifique ou d'autres sources publiques. Simultanément, les modèles seront également exposés à une quantité massive (des millions) de notes en texte libre obtenues à partir des dossiers médicaux utilisés dans les hôpitaux participants. Nous passerons ensuite à la mise au point, où une grande quantité (des milliers) de notes cliniques, obtenues, là encore, à partir des dossiers médicaux des centres participants, seront utilisées. Ces notes seront annotées par des médecins expérimentés, ce qui consiste à extraire des informations des notes pour remplir les éléments de données répertoriés dans un formulaire de collecte de données virtuelle (vCRF). Le vCRF a été créé pour une étude connexe et contient un ensemble de variables utiles pour prédire l'hospitalisation de patients souffrant de dyspnée ou de perte de conscience transitoire, ce qui est l'objectif de l'étude connexe. Dans la présente étude, le vCRF servira d'outil de validation du modèle de langage.

La validation de eCREAM_LM sera réalisée à l'aide d'un ensemble de 1 000 notes cliniques annotées comme décrit ci-dessus, mais non utilisées en phase de développement. Ces notes seront soumises au modèle eCREAM_LM avec pour tâche de compiler le vCRF. La concordance de remplissage du vCRF entre les médecins experts et l'eCREAM_LM sera la mesure de validation finale de l'eCREAM_LM.

Collecte et anonymisation des données

Chaque hôpital participant fournira gratuitement des notes textuelles contenues dans les dossiers médicaux de 150 à 300 000 patients adultes traités entre 2021 et 2023. Les notes faisant référence à différents aspects d'un même patient (par exemple, antécédents, examen objectif, résultats de tests) seront séparées les unes des autres de sorte qu'il sera impossible de reconstituer le profil complet du patient. De plus, les notes seront débarrassées de toute référence au patient (ex. : prénom, nom, date de naissance) et au contexte (ex. : hôpital, date et heure d'arrivée au centre). Ce processus minimise la probabilité de ré-identification des patients et maximise la protection de leurs droits. La probabilité de réidentifier un patient dans une base de données dépend de la manière dont ses caractéristiques sont uniques par rapport aux autres individus de la base de données. La probabilité d’avoir des patients uniques, et donc identifiables, augmente avec la quantité d’informations disponibles dans la base de données et diminue avec sa taille. En supprimant toutes les informations personnelles et contextuelles des notes cliniques et en séparant chaque note des autres, chaque note ne rapportera que quelques caractéristiques du patient. De plus, les données collectées auprès des hôpitaux d'un même pays seront fusionnées afin de disposer d'une grande base de données pour chaque langue. Cela élimine effectivement la probabilité qu’il y ait des individus identifiables de manière unique à partir des notes.

Enfin, pour exclure la possibilité que les notes contiennent des informations sur des tiers, telles que les noms et numéros de téléphone des proches des patients, un logiciel d'anonymisation certifié, spécialement conçu pour supprimer les données personnelles du texte libre, sera installé dans chaque hôpital.

Une fois anonymisées, les données seront centralisées pour analyse et seront également téléchargées sur les principales plateformes européennes de partage de ressources linguistiques au sein de la communauté scientifique.

analyses statistiques

Dans la validation eCREAM_LM, nous évaluerons la concordance entre les médecins urgentistes experts et l'eCREAM_LM lui-même pour remplir le vCRF. Les données se référeront à un échantillon de 1 000 notes pour chaque langue étudiée. La concordance sera évaluée pour chaque variable du vCRF en utilisant le κ de Cohen comme mesure d'accord. L'eCREAM_LM sera considéré comme valide si le κ de Cohen est supérieur à 0,75.

Taille de l'échantillon

En supposant un excellent accord (κ = 0,80) entre eCREAM_LM et les urgentistes expérimentés pour remplir le vCRF, un échantillon d'au moins 735 notes sera nécessaire pour obtenir une précision suffisante pour garantir un bon accord (limite de confiance inférieure de 95 % d'intervalle de confiance de κ de Cohen supérieur à 0,75). Ce nombre est la taille maximale de l'échantillon obtenue dans différents scénarios impliquant un nombre différent de catégories (2 à 5) pour chaque variable et différentes distributions marginales des catégories dans l'échantillon, y compris des distributions équilibrées (par exemple, 5 catégories avec 20 % de l'échantillon dans chaque catégorie) et des résultats très déséquilibrés (ex. 5 catégories avec 1,8%, 7,3%, 16,4%, 29,1% et 45,5% de l'échantillon). Étant donné que des informations intéressantes peuvent manquer dans certaines notes, nous effectuerons l'évaluation de validation des données sur 1 000 notes.

Type d'étude

Observationnel

Inscription (Estimé)

300000

Contacts et emplacements

Cette section fournit les coordonnées de ceux qui mènent l'étude et des informations sur le lieu où cette étude est menée.

Coordonnées de l'étude

Sauvegarde des contacts de l'étude

Lieux d'étude

      • Catania, Italie
        • Pas encore de recrutement
        • AOU Policlinico 'G.Rodolico - San Marco'
        • Contact:
      • Milan, Italie
      • Milan, Italie
        • Pas encore de recrutement
        • ASST Grande Ospedale Metropolitano Niguarda
        • Contact:
      • Orbassano, Italie
        • Pas encore de recrutement
        • Ospedale San Luigi Gonzaga
        • Contact:
          • Valeria Caramello
          • Numéro de téléphone: v.caramello@sa +39 011 90261
      • Pozzuoli, Italie
        • Pas encore de recrutement
        • Ospedale Santa Maria delle Grazie
        • Contact:
      • Torino, Italie
      • Vercelli, Italie
        • Recrutement
        • Ospedale Sant'Andrea
        • Contact:
    • Milan
      • Milan, Milan, Italie, 20156
        • Pas encore de recrutement
        • Istituto di Ricerche Farmacologiche Mario Negri IRCCS
        • Contact:

Critères de participation

Les chercheurs recherchent des personnes qui correspondent à une certaine description, appelée critères d'éligibilité. Certains exemples de ces critères sont l'état de santé général d'une personne ou des traitements antérieurs.

Critère d'éligibilité

Âges éligibles pour étudier

  • Adulte
  • Adulte plus âgé

Accepte les volontaires sains

Oui

Méthode d'échantillonnage

Échantillon de probabilité

Population étudiée

Tous les patients adultes arrivés aux services d’urgence participants entre le 1er janvier 2021 et le 31 décembre 2023

La description

Critère d'intégration:

  • Adulte
  • Arrivé aux urgences entre le 1er janvier 2021 et le 31 décembre 2023

Critère d'exclusion:

  • Aucun

Plan d'étude

Cette section fournit des détails sur le plan d'étude, y compris la façon dont l'étude est conçue et ce que l'étude mesure.

Comment l'étude est-elle conçue ?

Détails de conception

Cohortes et interventions

Groupe / Cohorte
Intervention / Traitement
Adultes ayant consulté aux urgences
aucune intervention

Que mesure l'étude ?

Principaux critères de jugement

Mesure des résultats
Description de la mesure
Délai
Concordance dans le remplissage du formulaire de rapport de cas virtuel
Délai: 1 mois
Niveau de concordance du remplissage du formulaire d'observation virtuelle entre les médecins experts et le modèle de langage eCREAM_LM
1 mois

Collaborateurs et enquêteurs

C'est ici que vous trouverez les personnes et les organisations impliquées dans cette étude.

Les enquêteurs

  • Chercheur principal: Guido Bertolini, Istituto Di Ricerche Farmacologiche Mario Negri

Dates d'enregistrement des études

Ces dates suivent la progression des dossiers d'étude et des soumissions de résultats sommaires à ClinicalTrials.gov. Les dossiers d'étude et les résultats rapportés sont examinés par la Bibliothèque nationale de médecine (NLM) pour s'assurer qu'ils répondent à des normes de contrôle de qualité spécifiques avant d'être publiés sur le site Web public.

Dates principales de l'étude

Début de l'étude (Réel)

1 octobre 2024

Achèvement primaire (Estimé)

1 janvier 2027

Achèvement de l'étude (Estimé)

1 septembre 2027

Dates d'inscription aux études

Première soumission

26 janvier 2024

Première soumission répondant aux critères de contrôle qualité

26 janvier 2024

Première publication (Réel)

5 février 2024

Mises à jour des dossiers d'étude

Dernière mise à jour publiée (Réel)

15 juillet 2026

Dernière mise à jour soumise répondant aux critères de contrôle qualité

14 juillet 2026

Dernière vérification

1 juillet 2026

Plus d'information

Termes liés à cette étude

Termes MeSH pertinents supplémentaires

Autres numéros d'identification d'étude

  • 8780

Plan pour les données individuelles des participants (IPD)

Prévoyez-vous de partager les données individuelles des participants (DPI) ?

OUI

Description du régime IPD

Les données anonymisées des participants individuels seront téléchargées sur les principales plateformes européennes de partage de ressources linguistiques au sein de la communauté scientifique, notamment le référentiel European Language Grid (https://live.europeanlingual-grid.eu), l'Observatoire virtuel des langues CLARIN (https : //vlo.clarin.eu/?2) et l'initiative européenne pour l'égalité linguistique (ELE) (https://european-lingual-equality.eu).

Délai de partage IPD

À partir de décembre 2025

Type d'informations de prise en charge du partage d'IPD

  • PROTOCOLE D'ÉTUDE
  • RSE

Informations sur les médicaments et les dispositifs, documents d'étude

Étudie un produit pharmaceutique réglementé par la FDA américaine

Non

Étudie un produit d'appareil réglementé par la FDA américaine

Non

produit fabriqué et exporté des États-Unis.

Non

Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .

S'abonner