- ICH GCP
- Registre américain des essais cliniques
- Essai clinique NCT06240572
Développement d'un outil de traitement du langage naturel pour permettre la recherche clinique en médecine d'urgence (NLP-DeVal)
Développement et validation d'un outil de traitement du langage naturel pour permettre la recherche clinique en médecine d'urgence et de soins aigus : étude de cohorte rétrospective
Le but de cette étude de cohorte rétrospective est de développer et de valider un modèle de langage capable d'interpréter le contenu des dossiers médicaux électroniques des services d'urgence et d'extraire des informations pertinentes à des fins de recherche chez tous les patients adultes arrivés aux services d'urgence participants au cours d'une période de trois ans. .
La principale question à laquelle il vise à répondre est la suivante : le modèle linguistique est-il capable d'interpréter le contenu des dossiers médicaux électroniques des services d'urgence et d'en extraire les informations demandées afin de pouvoir les utiliser pour effectuer des analyses et des prédictions précises ?
L'étude est rétrospective et les données seront extraites automatiquement des dossiers médicaux.
Aperçu de l'étude
Statut
Les conditions
Intervention / Traitement
Description détaillée
CONTEXTE ET JUSTIFICATION DE L’ÉTUDE
Mener des recherches sur l’évaluation clinique et de la qualité des soins en médecine d’urgence est aussi difficile qu’important. Cela est difficile car le grand nombre de patients à traiter et le manque chronique de personnel rendent difficile la collecte de données ponctuelles. C’est important parce qu’en fin de compte, la recherche permet aux urgentistes et aux infirmières de fonder leur pratique sur des preuves obtenues dans leur propre contexte, par opposition aux preuves obtenues dans des contextes éloignés, comme c’est généralement le cas aujourd’hui.
La seule façon de combler le fossé entre les besoins de recherche et la disponibilité de données robustes est d’extraire les données directement des dossiers de santé électroniques (DSE) des services d’urgence, évitant ainsi une collecte de données dédiée et fastidieuse. Il s’agit cependant d’une tâche difficile, car les informations les plus utiles sont sous forme de texte libre (par exemple, présence de signes et symptômes, diagnostic suspecté et confirmé, anamnèse). De telles circonstances et besoins nécessitent un outil fiable de traitement du langage naturel (NLP) pour dériver des données hautement cohérentes à partir de texte libre.
Aujourd’hui, il existe des modèles linguistiques à grande échelle capables d’interpréter avec précision le langage naturel. Ces modèles sont toutefois formés à partir d’énormes quantités de connaissances générales provenant principalement d’Internet, de sorte que leurs performances dans des domaines plus spécialisés, tels que le domaine médical, peuvent ne pas être optimales.
La présente étude fait partie d'un projet plus vaste appelé eCREAM (permettant la recherche clinique en médecine d'urgence et de soins aigus) et vise à développer et valider un modèle de langage (appelé eCREAM_LM) pour six langues capables d'interpréter le contenu des DSE des services d'urgence et extraire des informations pertinentes à des fins de recherche.
MÉTHODES
L'étude est une étude observationnelle, multicentrique et rétrospective d'une durée de 24 mois. Trente centres participeront à l'étude : 13 d'Italie, 4 de Pologne, 3 de Grèce, de Slovaquie, de Slovénie et du Royaume-Uni et 1 de Suisse. Les centres ne recevront aucune compensation, mais leurs dépenses seront couvertes par les fonds du projet.
Développement et validation du modèle eCREAM_LM.
eCREAM_LM sera développé grâce à la formation et à la mise au point du meilleur modèle global, parmi ceux open source, et se déroulera en phases partiellement parallèles. Les modèles candidats seront exposés à une quantité énorme (des milliards) de textes médicaux issus de la littérature scientifique ou d'autres sources publiques. Simultanément, les modèles seront également exposés à une quantité massive (des millions) de notes en texte libre obtenues à partir des dossiers médicaux utilisés dans les hôpitaux participants. Nous passerons ensuite à la mise au point, où une grande quantité (des milliers) de notes cliniques, obtenues, là encore, à partir des dossiers médicaux des centres participants, seront utilisées. Ces notes seront annotées par des médecins expérimentés, ce qui consiste à extraire des informations des notes pour remplir les éléments de données répertoriés dans un formulaire de collecte de données virtuelle (vCRF). Le vCRF a été créé pour une étude connexe et contient un ensemble de variables utiles pour prédire l'hospitalisation de patients souffrant de dyspnée ou de perte de conscience transitoire, ce qui est l'objectif de l'étude connexe. Dans la présente étude, le vCRF servira d'outil de validation du modèle de langage.
La validation de eCREAM_LM sera réalisée à l'aide d'un ensemble de 1 000 notes cliniques annotées comme décrit ci-dessus, mais non utilisées en phase de développement. Ces notes seront soumises au modèle eCREAM_LM avec pour tâche de compiler le vCRF. La concordance de remplissage du vCRF entre les médecins experts et l'eCREAM_LM sera la mesure de validation finale de l'eCREAM_LM.
Collecte et anonymisation des données
Chaque hôpital participant fournira gratuitement des notes textuelles contenues dans les dossiers médicaux de 150 à 300 000 patients adultes traités entre 2021 et 2023. Les notes faisant référence à différents aspects d'un même patient (par exemple, antécédents, examen objectif, résultats de tests) seront séparées les unes des autres de sorte qu'il sera impossible de reconstituer le profil complet du patient. De plus, les notes seront débarrassées de toute référence au patient (ex. : prénom, nom, date de naissance) et au contexte (ex. : hôpital, date et heure d'arrivée au centre). Ce processus minimise la probabilité de ré-identification des patients et maximise la protection de leurs droits. La probabilité de réidentifier un patient dans une base de données dépend de la manière dont ses caractéristiques sont uniques par rapport aux autres individus de la base de données. La probabilité d’avoir des patients uniques, et donc identifiables, augmente avec la quantité d’informations disponibles dans la base de données et diminue avec sa taille. En supprimant toutes les informations personnelles et contextuelles des notes cliniques et en séparant chaque note des autres, chaque note ne rapportera que quelques caractéristiques du patient. De plus, les données collectées auprès des hôpitaux d'un même pays seront fusionnées afin de disposer d'une grande base de données pour chaque langue. Cela élimine effectivement la probabilité qu’il y ait des individus identifiables de manière unique à partir des notes.
Enfin, pour exclure la possibilité que les notes contiennent des informations sur des tiers, telles que les noms et numéros de téléphone des proches des patients, un logiciel d'anonymisation certifié, spécialement conçu pour supprimer les données personnelles du texte libre, sera installé dans chaque hôpital.
Une fois anonymisées, les données seront centralisées pour analyse et seront également téléchargées sur les principales plateformes européennes de partage de ressources linguistiques au sein de la communauté scientifique.
analyses statistiques
Dans la validation eCREAM_LM, nous évaluerons la concordance entre les médecins urgentistes experts et l'eCREAM_LM lui-même pour remplir le vCRF. Les données se référeront à un échantillon de 1 000 notes pour chaque langue étudiée. La concordance sera évaluée pour chaque variable du vCRF en utilisant le κ de Cohen comme mesure d'accord. L'eCREAM_LM sera considéré comme valide si le κ de Cohen est supérieur à 0,75.
Taille de l'échantillon
En supposant un excellent accord (κ = 0,80) entre eCREAM_LM et les urgentistes expérimentés pour remplir le vCRF, un échantillon d'au moins 735 notes sera nécessaire pour obtenir une précision suffisante pour garantir un bon accord (limite de confiance inférieure de 95 % d'intervalle de confiance de κ de Cohen supérieur à 0,75). Ce nombre est la taille maximale de l'échantillon obtenue dans différents scénarios impliquant un nombre différent de catégories (2 à 5) pour chaque variable et différentes distributions marginales des catégories dans l'échantillon, y compris des distributions équilibrées (par exemple, 5 catégories avec 20 % de l'échantillon dans chaque catégorie) et des résultats très déséquilibrés (ex. 5 catégories avec 1,8%, 7,3%, 16,4%, 29,1% et 45,5% de l'échantillon). Étant donné que des informations intéressantes peuvent manquer dans certaines notes, nous effectuerons l'évaluation de validation des données sur 1 000 notes.
Type d'étude
Inscription (Estimé)
Contacts et emplacements
Coordonnées de l'étude
- Nom: Chiara Pandolfini
- Numéro de téléphone: 0039 02 39014 253
- E-mail: chiara.pandolfini@marionegri.it
Sauvegarde des contacts de l'étude
- Nom: Giulia Ghilardi
- Numéro de téléphone: 0039 035 4535 313
- E-mail: giulia.ghilardi@marionegri.it
Lieux d'étude
-
-
-
Catania, Italie
- Pas encore de recrutement
- AOU Policlinico 'G.Rodolico - San Marco'
-
Contact:
- Giuseppe Carpinteri
- Numéro de téléphone: +39 095 378 1111
- E-mail: gicarpinteri@gmail.com
-
Milan, Italie
- Pas encore de recrutement
- Ospedale Luigi Sacco
-
Contact:
- Anna Maria Brambilla
- Numéro de téléphone: +39 02 39041
- E-mail: brambilla.annamaria@asst-fbf-sacco.it
-
Milan, Italie
- Pas encore de recrutement
- ASST Grande Ospedale Metropolitano Niguarda
-
Contact:
- Nicolò Capsoni
- Numéro de téléphone: +39 02 64441
- E-mail: nicolo.capsoni@gmail.com
-
Orbassano, Italie
- Pas encore de recrutement
- Ospedale San Luigi Gonzaga
-
Contact:
- Valeria Caramello
- Numéro de téléphone: v.caramello@sa +39 011 90261
-
Pozzuoli, Italie
- Pas encore de recrutement
- Ospedale Santa Maria delle Grazie
-
Contact:
- Giovanni Porta
- Numéro de téléphone: +39 081 855 2320
- E-mail: dottorgiovanniporta@gmail.com
-
Torino, Italie
- Recrutement
- Ospedale San Giovanni Bosco
-
Contact:
- Franco Aprà
- Numéro de téléphone: +39 011 240 2210
- E-mail: franco.apra@aslcittaditorino.it
-
Vercelli, Italie
- Recrutement
- Ospedale Sant'Andrea
-
Contact:
- Sergio Tartaglia
- Numéro de téléphone: +39 0161 593111
- E-mail: srtartaglia@gmail.com
-
-
Milan
-
Milan, Milan, Italie, 20156
- Pas encore de recrutement
- Istituto di Ricerche Farmacologiche Mario Negri IRCCS
-
Contact:
- Guido Bertolini, MD
- E-mail: guido.bertolini@marionegri.it
-
-
Critères de participation
Critère d'éligibilité
Âges éligibles pour étudier
- Adulte
- Adulte plus âgé
Accepte les volontaires sains
Méthode d'échantillonnage
Population étudiée
La description
Critère d'intégration:
- Adulte
- Arrivé aux urgences entre le 1er janvier 2021 et le 31 décembre 2023
Critère d'exclusion:
- Aucun
Plan d'étude
Comment l'étude est-elle conçue ?
Détails de conception
Cohortes et interventions
Groupe / Cohorte |
Intervention / Traitement |
|---|---|
|
Adultes ayant consulté aux urgences
|
aucune intervention
|
Que mesure l'étude ?
Principaux critères de jugement
Mesure des résultats |
Description de la mesure |
Délai |
|---|---|---|
|
Concordance dans le remplissage du formulaire de rapport de cas virtuel
Délai: 1 mois
|
Niveau de concordance du remplissage du formulaire d'observation virtuelle entre les médecins experts et le modèle de langage eCREAM_LM
|
1 mois
|
Collaborateurs et enquêteurs
Les enquêteurs
- Chercheur principal: Guido Bertolini, Istituto Di Ricerche Farmacologiche Mario Negri
Dates d'enregistrement des études
Dates principales de l'étude
Début de l'étude (Réel)
Achèvement primaire (Estimé)
Achèvement de l'étude (Estimé)
Dates d'inscription aux études
Première soumission
Première soumission répondant aux critères de contrôle qualité
Première publication (Réel)
Mises à jour des dossiers d'étude
Dernière mise à jour publiée (Réel)
Dernière mise à jour soumise répondant aux critères de contrôle qualité
Dernière vérification
Plus d'information
Termes liés à cette étude
Termes MeSH pertinents supplémentaires
Autres numéros d'identification d'étude
- 8780
Plan pour les données individuelles des participants (IPD)
Prévoyez-vous de partager les données individuelles des participants (DPI) ?
Description du régime IPD
Délai de partage IPD
Type d'informations de prise en charge du partage d'IPD
- PROTOCOLE D'ÉTUDE
- RSE
Informations sur les médicaments et les dispositifs, documents d'étude
Étudie un produit pharmaceutique réglementé par la FDA américaine
Étudie un produit d'appareil réglementé par la FDA américaine
produit fabriqué et exporté des États-Unis.
Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .