Cette page a été traduite automatiquement et l'exactitude de la traduction n'est pas garantie. Veuillez vous référer au version anglaise pour un texte source.

Étude d'acquisition de données avec intelligence artificielle et phénotypage de patients atteints d'embolie pulmonaire aiguë (PEPITE)

Étude d'acquisition de données avec intelligence artificielle et phénotypage de patients ayant présenté une embolie pulmonaire aiguë

L'objectif initial est de construire et de valider des outils d'intelligence artificielle (machine learning et Natural Language Processing) pour acquérir et structurer les données issues des rapports médicaux du Centre Hospitalier Intercommunal de Toulon - la Seyne sur mer (CHITS). Ce projet s'appuiera sur les travaux réalisés précédemment par le Département d'épidémiologie, de biostatistiques et de données de santé (DEBDS) du Centre Antoine Lacassagne (CAL) à Nice, en se concentrant sur les cancers du sein et de la thyroïde. L'idée est de valider la transférabilité de ces outils vers un autre établissement avec des pathologies et des praticiens différents, notamment le service de médecine vasculaire du CHITS.

Par la suite, l'objectif sera d'identifier les phénotypes cliniquement pertinents chez les patients atteints d'embolie pulmonaire aiguë. Des méthodes de clustering hiérarchique combinées à un apprentissage non supervisé (machine learning) seront utilisées pour obtenir des groupes de patients homogènes au moment du diagnostic. Évaluer leur pronostic à 6 mois (récidive ou hypertension pulmonaire thromboembolique chronique), compte tenu des 3 premiers mois de traitement anticoagulant, apporterait une aide à la décision médicale.

Cette recherche comprendra une rétrospective et une partie prospective. La partie rétrospective inclura les patients admis au CHITS pour embolie pulmonaire aiguë depuis 2019. Pour la partie prospective, il est prévu d'inclure des patients présentant les mêmes caractéristiques sur les années 2024 et 2025. Plus de 2 500 patients devraient être inclus.

Cette recherche n’aura aucun impact sur les soins actuels aux patients. Les données des consultations et divers examens réalisés dans le cadre des soins seront collectées pendant six mois post-diagnostic afin de répondre aux objectifs de recherche.

Aperçu de l'étude

Statut

Complété

Les conditions

Description détaillée

Contexte :

Intelligence Artificielle : PNL, clustering et apprentissage non supervisé :

L'intelligence artificielle (IA) est un domaine qui combine l'informatique et des ensembles de données, dans le but de permettre à une machine d'imiter les capacités cognitives de l'être humain. L’apprentissage automatique (ML) et son sous-domaine l’apprentissage profond, qui utilise des couches de neurones, sont deux sous-domaines majeurs de l’IA. La différence réside dans la formation de chaque algorithme. Deux méthodes distinctes sont utilisées par le ML : l'apprentissage supervisé, qui implique la formation d'un modèle sur des données d'entrée et de sortie connues pour prédire les sorties futures, et l'apprentissage non supervisé implique la découverte de modèles cachés et de structures sous-jacentes intrinsèques dans les données d'entrée. Le traitement du langage naturel (NLP) est également un sous-domaine de l'IA, mais il nécessite généralement le ML pour être efficace. La PNL traite les données linguistiques du monde réel pour leur donner un sens d'une manière qu'un ordinateur peut comprendre.

La PNL comporte deux étapes principales : le prétraitement des données et le développement d'algorithmes. Les langages de programmation tels que Python ou R sont largement utilisés pour ces techniques.

Le but des méthodes de clustering est de regrouper un ensemble d’individus en classes homogènes. Des méthodes non hiérarchiques peuvent être utilisées pour classer des données massives mais nécessitent de fixer au préalable le nombre de classes. Les méthodes hiérarchiques, plus longues à calculer, consistent en une série de partitions imbriquées représentées par un arbre de clustering. Le nombre optimal de classes peut être déterminé a posteriori par la lecture de l'arbre. En présence d’un grand nombre d’individus, il est courant de combiner des techniques non hiérarchiques et hiérarchiques. Lorsque les classes ne sont pas clairement connues à l’avance, les méthodes de clustering sont utilisées avec l’apprentissage non supervisé (ML) [1]. Les ensembles de données sont généralement divisés en trois ensembles de données disjoints : les données d'entraînement, utilisées pour entraîner le ou les algorithmes choisis ; données de validation, utilisées pour vérifier la performance du résultat ; et les données de test, utilisées uniquement à la fin du processus.

Maladie thromboembolique veineuse :

La maladie thromboembolique veineuse (MTEV) est une pathologie courante dont l'incidence est imparfaitement connue, mais augmente avec l'âge, atteignant 1 % chez les sujets de plus de 75 ans. En France, on estime que chaque année plus de 100 000 personnes développent une TEV, responsable entre 5 000 et 10 000 décès. La thrombose veineuse profonde (TVP) et l'embolie pulmonaire (EP) sont les deux principaux types de TEV. La TVP correspond à une occlusion partielle ou totale d'une veine profonde par un thrombus, le plus souvent localisé au niveau des membres inférieurs. L'EP est définie comme une occlusion partielle ou totale des artères pulmonaires ou de leurs branches. Le principal risque de TVP est la survenue d’une EP, qui peut mettre la vie en danger. Parmi les autres complications spécifiques à la TEV et les effets indésirables possibles figurent la récidive thromboembolique (TVP ou EP), l'hypertension pulmonaire thromboembolique chronique et le syndrome post-thrombotique dans la TVP. La prise en charge actuelle de la TEV repose principalement sur le traitement anticoagulant. La durée du traitement varie en fonction du risque estimé de récidive en cas d'arrêt du traitement, essentiellement selon l'existence ou non d'un facteur de risque majeur antérieur [2]. Dans ce sous-groupe de patients EP, en l’absence de facteurs de risque majeurs, le risque de récidive est considéré comme intermédiaire et varie selon qu’il s’agit d’un premier épisode ou d’une récidive, et selon qu’il existe ou non des séquelles pulmonaires obstructives [3]. Plus récemment, la stratégie thérapeutique est devenue plus complexe, avec l'inclusion de facteurs de risque mineurs qui modulent la durée du traitement sans preuves pertinentes. Par ailleurs, quelle que soit la durée du traitement, la posologie de l'anticoagulation au-delà du sixième mois est incertaine pour les Anticoagulants Oraux Directs.

Hypothèses :

Cette recherche est présentée sous deux axes distincts :

AXE 1 : L'objectif de ce travail sera dans un premier temps de développer et valider des outils d'intelligence artificielle, utilisant le ML et le NLP, pour acquérir et structurer des données issues de rapports médicaux textuels dans le service de médecine vasculaire du Centre Hospitalier Intercommunal de Toulon - la Seyne. sur mer (CHITS). Ce projet s'appuiera sur les travaux réalisés antérieurement par le Département d'épidémiologie, de biostatistique et de données de santé (DEBDS) du Centre Antoine Lacassagne (CAL) axés sur les cancers du sein et de la thyroïde [5,6,7]. L'idée est de valider la transférabilité de ces outils vers un autre établissement avec des pathologies et des praticiens différents, notamment le service de médecine vasculaire du CHITS.

Mettre en œuvre une méthode d’acquisition de données structurées utilisant des techniques d’intelligence artificielle directement à partir de rapports médicaux textuels au sein de notre hôpital est un défi. Si ses performances sont prouvées et que cet outil est mis en œuvre de manière permanente et systématique, il constituerait une source d’informations facilement exploitable. La diversité des domaines et des intérêts en recherche clinique au sein de notre établissement peut faire du déploiement dans d'autres départements un objectif réalisable. Pour CHITS, il s’agit de la première étape du processus de création d’un Health Data Warehouse (HDW).

AXE 2 : Par la suite, l'objectif sera d'utiliser la base de données pour identifier des phénotypes cliniquement pertinents chez les patients atteints d'embolie pulmonaire aiguë. Des méthodes de clustering hiérarchique combinées à un apprentissage non supervisé (machine learning) seront utilisées pour obtenir des groupes de patients homogènes au moment du diagnostic. Évaluer leur pronostic à 6 mois (récidive ou hypertension pulmonaire thromboembolique chronique), compte tenu des 3 premiers mois de traitement anticoagulant, apporterait une aide à la décision médicale.

Une analyse de l'évolution sur six mois de groupes homogènes de patients atteints d'embolie pulmonaire aiguë, construite à l'aide de méthodes de clustering avec apprentissage non supervisé, n'a jamais été menée auparavant. Ce projet innovant au sein d'une infrastructure hospitalière de grande envergure est susceptible d'offrir aux médecins une aide à la décision et aux patients une prise en charge thérapeutique scientifiquement validée.

Matériel et méthodes :

Cette recherche comprendra une rétrospective et une partie prospective. La partie rétrospective inclura les patients admis au CHITS pour embolie pulmonaire aiguë depuis 2019 (environ 1900 patients). Pour la partie prospective, il est prévu d'inclure des patients présentant les mêmes caractéristiques sur les années 2024 et 2025 (environ 765 patients). Si les informations individuelles ne sont pas disponibles ou s'ils s'opposent au traitement de leurs données pour 25 % des patients, un grand volume de données sur plus de 2 500 patients pourrait potentiellement être analysé dans cet essai. Cette recherche n’aura aucun impact sur les soins actuels aux patients. Les données des consultations et divers examens réalisés dans le cadre des soins seront collectées pendant six mois post-diagnostic pour répondre aux objectifs de recherche.

AXE 1 : La méthode d'acquisition de données utilisée dans cette recherche sera double. Les données des patients inclus dans la recherche clinique seront collectées de manière classique à l'aide d'un formulaire d'observation, puis centralisées et organisées dans une base de données de référence appelée « Gold Standard », et saisies par un technicien de recherche clinique. La deuxième technique d'acquisition de données, utilisant les méthodes PNL, se déroulera en plusieurs étapes, parallèlement à l'approche précédente. Dans un premier temps, l’extraction des rapports médicaux (MR) sous format texte sera suivie d’une étape de pseudonymisation. L'ensemble de données MR sera ensuite préparé pour la formation et la validation en supprimant les caractères spéciaux et en identifiant le segment d'intérêt. Ensuite, MR sera annoté avec BRAT afin d'identifier les termes qui seront utilisés pour alimenter la base de données. Des scripts de formation seront appliqués sur 70% des patients afin de créer des modèles PNL. Lors de cette phase de formation, des règles médicales de post-traitement seront rédigées afin de traduire les informations identifiées par les modèles en données structurées. Le script ainsi finalisé est appliqué à la base de validation avec une évaluation de ses performances. Après les ajustements nécessaires, les performances du script final sont évaluées sur la base de données de test. Les performances seront évaluées en comparant les données obtenues automatiquement avec la base de données manuelle Gold Standard.

AXE 2 : Les méthodes de clustering non supervisé utilisées dans cette étude combinent des méthodes hiérarchiques et non hiérarchiques. Suivant le regroupement hiérarchique ascendant, l'indice de Ward est utilisé pour déterminer le nombre de groupes d'intérêt. Les centroïdes de ces groupes sont ensuite considérés pour initialiser un algorithme de partitionnement, tel que l'algorithme des k-moyennes. Une fois que les groupes les plus médicalement pertinents ont été déterminés, l'évolution sur six mois (stable, aggravation ou progrès) est comparée. Les facteurs influençant la progression au cours des trois premiers mois de traitement peuvent également être inclus dans un modèle statistique, en fonction de leur capacité à prédire l'aggravation. Toutes ces explorations devraient servir de base à la prise de décision médicale.

Type d'étude

Observationnel

Inscription (Réel)

2350

Contacts et emplacements

Cette section fournit les coordonnées de ceux qui mènent l'étude et des informations sur le lieu où cette étude est menée.

Lieux d'étude

      • Toulon, France, 83100
        • Centre hospitalier intercommunal Toulon La Seyne sur Mer - Internal and vascular medicine

Critères de participation

Les chercheurs recherchent des personnes qui correspondent à une certaine description, appelée critères d'éligibilité. Certains exemples de ces critères sont l'état de santé général d'une personne ou des traitements antérieurs.

Critère d'éligibilité

Âges éligibles pour étudier

  • Adulte
  • Adulte plus âgé

Accepte les volontaires sains

Non

Méthode d'échantillonnage

Échantillon non probabiliste

Population étudiée

Cette recherche comprendra une rétrospective et une partie prospective. La partie rétrospective inclura les patients admis au CHITS pour embolie pulmonaire aiguë depuis 2019 (environ 1900 patients). Pour la partie prospective, il est prévu d'inclure des patients présentant les mêmes caractéristiques sur les années 2024 et 2025.

La description

Critère d'intégration:

  • Âge ≥ 18 ans ;
  • Patient présentant une embolie pulmonaire aiguë au CHITS (hospitalisé ou non).

Critère d'exclusion:

  • Embolies pulmonaires sous-segmentaires ;
  • Une opposition patiente.

Plan d'étude

Cette section fournit des détails sur le plan d'étude, y compris la façon dont l'étude est conçue et ce que l'étude mesure.

Comment l'étude est-elle conçue ?

Détails de conception

Cohortes et interventions

Groupe / Cohorte
Intervention / Traitement
Patient présentant une embolie pulmonaire aiguë
Patient atteint d'embolie pulmonaire aiguë au Centre Hospitalier Intercommunal Toulon La Seyne sur Mer, hospitalisé ou non depuis 2019
Des méthodes de regroupement hiérarchique seront utilisées pour former des groupes homogènes de patients en fonction de leurs données au moment du diagnostic : présence ou absence de symptômes, données cliniques et biologiques et présence ou absence de facteurs favorisants. L'évolution du patient à 6 mois peut se répartir en catégories : stable, aggravation ou progression, qui sont déterminées par des événements tels que la récidive, l'hémorragie, les séquelles fonctionnelles ou le décès.

Que mesure l'étude ?

Principaux critères de jugement

Mesure des résultats
Description de la mesure
Délai
Primaire: Identifier les groupes homogènes de patients en fonction de leurs caractéristiques médicales au diagnostic, puis comparer leur évolution à 6 mois.
Délai: 6 mois
Des méthodes de regroupement hiérarchiques seront utilisées pour former des groupes homogènes de patients en fonction de leurs données au diagnostic: présence ou absence de symptômes, données cliniques et biologiques, et présence ou absence de facteurs favorables. L'évolution des patients à 6 mois peut tomber en catégories: stable, aggravation ou progression, qui sont déterminées par des événements tels que la récidive, l'hémorragie, les séquelles fonctionnelles ou la mort.
6 mois

Mesures de résultats secondaires

Mesure des résultats
Description de la mesure
Délai
Secondaire: déterminer les facteurs prédictifs de la progression de 6 mois au cours des trois premiers mois de traitement.
Délai: 3 mois
A priori, les groupes définis pour l'objectif primaire seront maintenus. Les facteurs considérés au cours des trois premiers mois de traitement comprendront: les données cliniques et biologiques, la présence ou l'absence de symptômes, les facteurs ou complications favorables.
3 mois

Collaborateurs et enquêteurs

C'est ici que vous trouverez les personnes et les organisations impliquées dans cette étude.

Collaborateurs

Les enquêteurs

  • Directeur d'études: Jean-Noël POGGI, MD, Centre Hospitalier Intercommunal Toulon La Seyne sur Mer

Publications et liens utiles

La personne responsable de la saisie des informations sur l'étude fournit volontairement ces publications. Il peut s'agir de tout ce qui concerne l'étude.

Dates d'enregistrement des études

Ces dates suivent la progression des dossiers d'étude et des soumissions de résultats sommaires à ClinicalTrials.gov. Les dossiers d'étude et les résultats rapportés sont examinés par la Bibliothèque nationale de médecine (NLM) pour s'assurer qu'ils répondent à des normes de contrôle de qualité spécifiques avant d'être publiés sur le site Web public.

Dates principales de l'étude

Début de l'étude (Réel)

11 décembre 2023

Achèvement primaire (Réel)

1 juillet 2026

Achèvement de l'étude (Réel)

1 juillet 2026

Dates d'inscription aux études

Première soumission

13 décembre 2023

Première soumission répondant aux critères de contrôle qualité

26 décembre 2023

Première publication (Réel)

28 décembre 2023

Mises à jour des dossiers d'étude

Dernière mise à jour publiée (Réel)

7 juillet 2026

Dernière mise à jour soumise répondant aux critères de contrôle qualité

3 juillet 2026

Dernière vérification

1 juillet 2026

Plus d'information

Termes liés à cette étude

Plan pour les données individuelles des participants (IPD)

Prévoyez-vous de partager les données individuelles des participants (DPI) ?

NON

Informations sur les médicaments et les dispositifs, documents d'étude

Étudie un produit pharmaceutique réglementé par la FDA américaine

Non

Étudie un produit d'appareil réglementé par la FDA américaine

Non

Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .

S'abonner