- ICH GCP
- Registre américain des essais cliniques
- Essai clinique NCT06183944
Étude d'acquisition de données avec intelligence artificielle et phénotypage de patients atteints d'embolie pulmonaire aiguë (PEPITE)
Étude d'acquisition de données avec intelligence artificielle et phénotypage de patients ayant présenté une embolie pulmonaire aiguë
L'objectif initial est de construire et de valider des outils d'intelligence artificielle (machine learning et Natural Language Processing) pour acquérir et structurer les données issues des rapports médicaux du Centre Hospitalier Intercommunal de Toulon - la Seyne sur mer (CHITS). Ce projet s'appuiera sur les travaux réalisés précédemment par le Département d'épidémiologie, de biostatistiques et de données de santé (DEBDS) du Centre Antoine Lacassagne (CAL) à Nice, en se concentrant sur les cancers du sein et de la thyroïde. L'idée est de valider la transférabilité de ces outils vers un autre établissement avec des pathologies et des praticiens différents, notamment le service de médecine vasculaire du CHITS.
Par la suite, l'objectif sera d'identifier les phénotypes cliniquement pertinents chez les patients atteints d'embolie pulmonaire aiguë. Des méthodes de clustering hiérarchique combinées à un apprentissage non supervisé (machine learning) seront utilisées pour obtenir des groupes de patients homogènes au moment du diagnostic. Évaluer leur pronostic à 6 mois (récidive ou hypertension pulmonaire thromboembolique chronique), compte tenu des 3 premiers mois de traitement anticoagulant, apporterait une aide à la décision médicale.
Cette recherche comprendra une rétrospective et une partie prospective. La partie rétrospective inclura les patients admis au CHITS pour embolie pulmonaire aiguë depuis 2019. Pour la partie prospective, il est prévu d'inclure des patients présentant les mêmes caractéristiques sur les années 2024 et 2025. Plus de 2 500 patients devraient être inclus.
Cette recherche n’aura aucun impact sur les soins actuels aux patients. Les données des consultations et divers examens réalisés dans le cadre des soins seront collectées pendant six mois post-diagnostic afin de répondre aux objectifs de recherche.
Aperçu de l'étude
Statut
Les conditions
Intervention / Traitement
Description détaillée
Contexte :
Intelligence Artificielle : PNL, clustering et apprentissage non supervisé :
L'intelligence artificielle (IA) est un domaine qui combine l'informatique et des ensembles de données, dans le but de permettre à une machine d'imiter les capacités cognitives de l'être humain. L’apprentissage automatique (ML) et son sous-domaine l’apprentissage profond, qui utilise des couches de neurones, sont deux sous-domaines majeurs de l’IA. La différence réside dans la formation de chaque algorithme. Deux méthodes distinctes sont utilisées par le ML : l'apprentissage supervisé, qui implique la formation d'un modèle sur des données d'entrée et de sortie connues pour prédire les sorties futures, et l'apprentissage non supervisé implique la découverte de modèles cachés et de structures sous-jacentes intrinsèques dans les données d'entrée. Le traitement du langage naturel (NLP) est également un sous-domaine de l'IA, mais il nécessite généralement le ML pour être efficace. La PNL traite les données linguistiques du monde réel pour leur donner un sens d'une manière qu'un ordinateur peut comprendre.
La PNL comporte deux étapes principales : le prétraitement des données et le développement d'algorithmes. Les langages de programmation tels que Python ou R sont largement utilisés pour ces techniques.
Le but des méthodes de clustering est de regrouper un ensemble d’individus en classes homogènes. Des méthodes non hiérarchiques peuvent être utilisées pour classer des données massives mais nécessitent de fixer au préalable le nombre de classes. Les méthodes hiérarchiques, plus longues à calculer, consistent en une série de partitions imbriquées représentées par un arbre de clustering. Le nombre optimal de classes peut être déterminé a posteriori par la lecture de l'arbre. En présence d’un grand nombre d’individus, il est courant de combiner des techniques non hiérarchiques et hiérarchiques. Lorsque les classes ne sont pas clairement connues à l’avance, les méthodes de clustering sont utilisées avec l’apprentissage non supervisé (ML) [1]. Les ensembles de données sont généralement divisés en trois ensembles de données disjoints : les données d'entraînement, utilisées pour entraîner le ou les algorithmes choisis ; données de validation, utilisées pour vérifier la performance du résultat ; et les données de test, utilisées uniquement à la fin du processus.
Maladie thromboembolique veineuse :
La maladie thromboembolique veineuse (MTEV) est une pathologie courante dont l'incidence est imparfaitement connue, mais augmente avec l'âge, atteignant 1 % chez les sujets de plus de 75 ans. En France, on estime que chaque année plus de 100 000 personnes développent une TEV, responsable entre 5 000 et 10 000 décès. La thrombose veineuse profonde (TVP) et l'embolie pulmonaire (EP) sont les deux principaux types de TEV. La TVP correspond à une occlusion partielle ou totale d'une veine profonde par un thrombus, le plus souvent localisé au niveau des membres inférieurs. L'EP est définie comme une occlusion partielle ou totale des artères pulmonaires ou de leurs branches. Le principal risque de TVP est la survenue d’une EP, qui peut mettre la vie en danger. Parmi les autres complications spécifiques à la TEV et les effets indésirables possibles figurent la récidive thromboembolique (TVP ou EP), l'hypertension pulmonaire thromboembolique chronique et le syndrome post-thrombotique dans la TVP. La prise en charge actuelle de la TEV repose principalement sur le traitement anticoagulant. La durée du traitement varie en fonction du risque estimé de récidive en cas d'arrêt du traitement, essentiellement selon l'existence ou non d'un facteur de risque majeur antérieur [2]. Dans ce sous-groupe de patients EP, en l’absence de facteurs de risque majeurs, le risque de récidive est considéré comme intermédiaire et varie selon qu’il s’agit d’un premier épisode ou d’une récidive, et selon qu’il existe ou non des séquelles pulmonaires obstructives [3]. Plus récemment, la stratégie thérapeutique est devenue plus complexe, avec l'inclusion de facteurs de risque mineurs qui modulent la durée du traitement sans preuves pertinentes. Par ailleurs, quelle que soit la durée du traitement, la posologie de l'anticoagulation au-delà du sixième mois est incertaine pour les Anticoagulants Oraux Directs.
Hypothèses :
Cette recherche est présentée sous deux axes distincts :
AXE 1 : L'objectif de ce travail sera dans un premier temps de développer et valider des outils d'intelligence artificielle, utilisant le ML et le NLP, pour acquérir et structurer des données issues de rapports médicaux textuels dans le service de médecine vasculaire du Centre Hospitalier Intercommunal de Toulon - la Seyne. sur mer (CHITS). Ce projet s'appuiera sur les travaux réalisés antérieurement par le Département d'épidémiologie, de biostatistique et de données de santé (DEBDS) du Centre Antoine Lacassagne (CAL) axés sur les cancers du sein et de la thyroïde [5,6,7]. L'idée est de valider la transférabilité de ces outils vers un autre établissement avec des pathologies et des praticiens différents, notamment le service de médecine vasculaire du CHITS.
Mettre en œuvre une méthode d’acquisition de données structurées utilisant des techniques d’intelligence artificielle directement à partir de rapports médicaux textuels au sein de notre hôpital est un défi. Si ses performances sont prouvées et que cet outil est mis en œuvre de manière permanente et systématique, il constituerait une source d’informations facilement exploitable. La diversité des domaines et des intérêts en recherche clinique au sein de notre établissement peut faire du déploiement dans d'autres départements un objectif réalisable. Pour CHITS, il s’agit de la première étape du processus de création d’un Health Data Warehouse (HDW).
AXE 2 : Par la suite, l'objectif sera d'utiliser la base de données pour identifier des phénotypes cliniquement pertinents chez les patients atteints d'embolie pulmonaire aiguë. Des méthodes de clustering hiérarchique combinées à un apprentissage non supervisé (machine learning) seront utilisées pour obtenir des groupes de patients homogènes au moment du diagnostic. Évaluer leur pronostic à 6 mois (récidive ou hypertension pulmonaire thromboembolique chronique), compte tenu des 3 premiers mois de traitement anticoagulant, apporterait une aide à la décision médicale.
Une analyse de l'évolution sur six mois de groupes homogènes de patients atteints d'embolie pulmonaire aiguë, construite à l'aide de méthodes de clustering avec apprentissage non supervisé, n'a jamais été menée auparavant. Ce projet innovant au sein d'une infrastructure hospitalière de grande envergure est susceptible d'offrir aux médecins une aide à la décision et aux patients une prise en charge thérapeutique scientifiquement validée.
Matériel et méthodes :
Cette recherche comprendra une rétrospective et une partie prospective. La partie rétrospective inclura les patients admis au CHITS pour embolie pulmonaire aiguë depuis 2019 (environ 1900 patients). Pour la partie prospective, il est prévu d'inclure des patients présentant les mêmes caractéristiques sur les années 2024 et 2025 (environ 765 patients). Si les informations individuelles ne sont pas disponibles ou s'ils s'opposent au traitement de leurs données pour 25 % des patients, un grand volume de données sur plus de 2 500 patients pourrait potentiellement être analysé dans cet essai. Cette recherche n’aura aucun impact sur les soins actuels aux patients. Les données des consultations et divers examens réalisés dans le cadre des soins seront collectées pendant six mois post-diagnostic pour répondre aux objectifs de recherche.
AXE 1 : La méthode d'acquisition de données utilisée dans cette recherche sera double. Les données des patients inclus dans la recherche clinique seront collectées de manière classique à l'aide d'un formulaire d'observation, puis centralisées et organisées dans une base de données de référence appelée « Gold Standard », et saisies par un technicien de recherche clinique. La deuxième technique d'acquisition de données, utilisant les méthodes PNL, se déroulera en plusieurs étapes, parallèlement à l'approche précédente. Dans un premier temps, l’extraction des rapports médicaux (MR) sous format texte sera suivie d’une étape de pseudonymisation. L'ensemble de données MR sera ensuite préparé pour la formation et la validation en supprimant les caractères spéciaux et en identifiant le segment d'intérêt. Ensuite, MR sera annoté avec BRAT afin d'identifier les termes qui seront utilisés pour alimenter la base de données. Des scripts de formation seront appliqués sur 70% des patients afin de créer des modèles PNL. Lors de cette phase de formation, des règles médicales de post-traitement seront rédigées afin de traduire les informations identifiées par les modèles en données structurées. Le script ainsi finalisé est appliqué à la base de validation avec une évaluation de ses performances. Après les ajustements nécessaires, les performances du script final sont évaluées sur la base de données de test. Les performances seront évaluées en comparant les données obtenues automatiquement avec la base de données manuelle Gold Standard.
AXE 2 : Les méthodes de clustering non supervisé utilisées dans cette étude combinent des méthodes hiérarchiques et non hiérarchiques. Suivant le regroupement hiérarchique ascendant, l'indice de Ward est utilisé pour déterminer le nombre de groupes d'intérêt. Les centroïdes de ces groupes sont ensuite considérés pour initialiser un algorithme de partitionnement, tel que l'algorithme des k-moyennes. Une fois que les groupes les plus médicalement pertinents ont été déterminés, l'évolution sur six mois (stable, aggravation ou progrès) est comparée. Les facteurs influençant la progression au cours des trois premiers mois de traitement peuvent également être inclus dans un modèle statistique, en fonction de leur capacité à prédire l'aggravation. Toutes ces explorations devraient servir de base à la prise de décision médicale.
Type d'étude
Inscription (Réel)
Contacts et emplacements
Lieux d'étude
-
-
-
Toulon, France, 83100
- Centre hospitalier intercommunal Toulon La Seyne sur Mer - Internal and vascular medicine
-
-
Critères de participation
Critère d'éligibilité
Âges éligibles pour étudier
- Adulte
- Adulte plus âgé
Accepte les volontaires sains
Méthode d'échantillonnage
Population étudiée
La description
Critère d'intégration:
- Âge ≥ 18 ans ;
- Patient présentant une embolie pulmonaire aiguë au CHITS (hospitalisé ou non).
Critère d'exclusion:
- Embolies pulmonaires sous-segmentaires ;
- Une opposition patiente.
Plan d'étude
Comment l'étude est-elle conçue ?
Détails de conception
Cohortes et interventions
Groupe / Cohorte |
Intervention / Traitement |
|---|---|
|
Patient présentant une embolie pulmonaire aiguë
Patient atteint d'embolie pulmonaire aiguë au Centre Hospitalier Intercommunal Toulon La Seyne sur Mer, hospitalisé ou non depuis 2019
|
Des méthodes de regroupement hiérarchique seront utilisées pour former des groupes homogènes de patients en fonction de leurs données au moment du diagnostic : présence ou absence de symptômes, données cliniques et biologiques et présence ou absence de facteurs favorisants.
L'évolution du patient à 6 mois peut se répartir en catégories : stable, aggravation ou progression, qui sont déterminées par des événements tels que la récidive, l'hémorragie, les séquelles fonctionnelles ou le décès.
|
Que mesure l'étude ?
Principaux critères de jugement
Mesure des résultats |
Description de la mesure |
Délai |
|---|---|---|
|
Primaire: Identifier les groupes homogènes de patients en fonction de leurs caractéristiques médicales au diagnostic, puis comparer leur évolution à 6 mois.
Délai: 6 mois
|
Des méthodes de regroupement hiérarchiques seront utilisées pour former des groupes homogènes de patients en fonction de leurs données au diagnostic: présence ou absence de symptômes, données cliniques et biologiques, et présence ou absence de facteurs favorables.
L'évolution des patients à 6 mois peut tomber en catégories: stable, aggravation ou progression, qui sont déterminées par des événements tels que la récidive, l'hémorragie, les séquelles fonctionnelles ou la mort.
|
6 mois
|
Mesures de résultats secondaires
Mesure des résultats |
Description de la mesure |
Délai |
|---|---|---|
|
Secondaire: déterminer les facteurs prédictifs de la progression de 6 mois au cours des trois premiers mois de traitement.
Délai: 3 mois
|
A priori, les groupes définis pour l'objectif primaire seront maintenus.
Les facteurs considérés au cours des trois premiers mois de traitement comprendront: les données cliniques et biologiques, la présence ou l'absence de symptômes, les facteurs ou complications favorables.
|
3 mois
|
Collaborateurs et enquêteurs
Collaborateurs
Les enquêteurs
- Directeur d'études: Jean-Noël POGGI, MD, Centre Hospitalier Intercommunal Toulon La Seyne sur Mer
Publications et liens utiles
Publications générales
- Gal J, Bailleux C, Chardin D, Pourcher T, Gilhodes J, Jing L, Guigonis JM, Ferrero JM, Milano G, Mograbi B, Brest P, Chateau Y, Humbert O, Chamorey E. Comparison of unsupervised machine-learning methods to identify metabolomic signatures in patients with localized breast cancer. Comput Struct Biotechnol J. 2020 Jun 3;18:1509-1524. doi: 10.1016/j.csbj.2020.05.021. eCollection 2020.
- Gallo A, Valerio L, Barco S. The 2019 European guidelines on pulmonary embolism illustrated with the aid of an exemplary case report. Eur Heart J Case Rep. 2021 Jan 4;5(2):ytaa542. doi: 10.1093/ehjcr/ytaa542. eCollection 2021 Feb.
- Duffett L, Castellucci LA, Forgie MA. Pulmonary embolism: update on management and controversies. BMJ. 2020 Aug 5;370:m2177. doi: 10.1136/bmj.m2177.
- Yu T, Shen R, You G, Lv L, Kang S, Wang X, Xu J, Zhu D, Xia Z, Zheng J, Huang K. Machine learning-based prediction of the post-thrombotic syndrome: Model development and validation study. Front Cardiovasc Med. 2022 Sep 16;9:990788. doi: 10.3389/fcvm.2022.990788. eCollection 2022.
Dates d'enregistrement des études
Dates principales de l'étude
Début de l'étude (Réel)
Achèvement primaire (Réel)
Achèvement de l'étude (Réel)
Dates d'inscription aux études
Première soumission
Première soumission répondant aux critères de contrôle qualité
Première publication (Réel)
Mises à jour des dossiers d'étude
Dernière mise à jour publiée (Réel)
Dernière mise à jour soumise répondant aux critères de contrôle qualité
Dernière vérification
Plus d'information
Termes liés à cette étude
Mots clés
Termes MeSH pertinents supplémentaires
Autres numéros d'identification d'étude
- 2023-CHITS-016
Plan pour les données individuelles des participants (IPD)
Prévoyez-vous de partager les données individuelles des participants (DPI) ?
Informations sur les médicaments et les dispositifs, documents d'étude
Étudie un produit pharmaceutique réglementé par la FDA américaine
Étudie un produit d'appareil réglementé par la FDA américaine
Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .