このページは自動翻訳されたものであり、翻訳の正確性は保証されていません。を参照してください。 英語版 ソーステキスト用。

救急医療における臨床研究を可能にする自然言語処理ツールの開発 (NLP-DeVal)

救急医療における臨床研究を可能にする自然言語処理ツールの開発と検証: 遡及的コホート研究

この後ろ向きコホート研究の目標は、3 年間に参加する救急科に到着したすべての成人患者を対象に、救急科の電子医療記録の内容を解釈し、研究目的で関連情報を抽出できる言語モデルを開発および検証することです。 。

それが答えることを目的とした主な質問は、言語モデルが救急部門の電子医療記録の内容を解釈し、そこから要求された情報を抽出して、正確な分析と予測を行うために使用できるかということです。

この研究は遡及的であり、データは医療記録から自動的に抽出されます。

調査の概要

状態

募集

条件

介入・治療

詳細な説明

研究の背景と理論的根拠

救急医療における臨床およびケアの質の評価研究を実施することは、重要であると同時に困難でもあります。 治療が必要な患者数が膨大であり、スタッフが慢性的に不足しているため、その場限りのデータ収集が現実的ではないため、これは困難です。 これが重要なのは、最終的には、研究により、救急医や看護師が、今日一般的に行われているように、遠く離れた状況で得られた証拠ではなく、独自の独自の環境で得られた証拠に基づいて診療を行うことができるからです。

研究ニーズと堅牢なデータの入手可能性との間のギャップを埋める唯一の方法は、時間のかかる専用のデータ収集を回避し、救急部門の電子医療記録 (EHR) から直接データを抽出することです。 ただし、最も有用な情報はフリーテキスト形式であるため、これは困難な作業です (兆候と症状の存在、診断の疑いと確定、既往歴など)。 このような状況とニーズには、フリー テキストから一貫性の高いデータを導き出すための信頼できる自然言語処理 (NLP) ツールが必要です。

現在、自然言語を正確に解釈できる大規模な言語モデルが利用可能です。 ただし、これらのモデルは主にインターネットから取得した膨大な一般知識に基づいてトレーニングされているため、医療分野などのより特殊な領域ではパフォーマンスが最適化されない可能性があります。

本研究は、eCREAM (救急医療における臨床研究の実現) と呼ばれる大規模プロジェクトの一部であり、救急部門の EHR と救急医療の内容を解釈できる 6 つの言語の言語モデル (eCREAM_LM と呼ばれる) を開発および検証することを目的としています。研究目的で関連情報を抽出する。

方法

この研究は、観察的、多施設共同、遡及的な 24 か月の研究です。 この研究には30の施設が参加する予定で、イタリアから13施設、ポーランドから4施設、ギリシャ、スロバキア、スロベニア、英国から3施設、スイスから1施設が参加する。 センターへの報酬はありませんが、費用はプロジェクト資金によって賄われます。

eCREAM_LM モデルの開発と検証。

eCREAM_LM は、オープンソース モデルの中から最適な全体モデルのトレーニングと微調整を通じて開発され、部分的に並行したフェーズで進められます。 候補モデルは、科学文献やその他の公的情報源からの膨大な量(数十億)の医学文書にさらされることになります。 同時に、モデルは、参加病院で使用されている医療記録から取得した大量(何百万もの)の自由テキストメモにもさらされることになります。 その後、微調整に進み、参加センターの医療記録から再度取得した大量(数千件)の臨床ノートが使用されます。 これらのメモには経験豊富な医師によって注釈が付けられます。これは、仮想データ収集フォーム (vCRF) にリストされているデータ項目を埋めるためにメモから情報を抽出することで構成されます。 vCRF は関連研究のために作成され、関連研究の目的である呼吸困難または一時的な意識喪失を伴う患者の入院を予測するのに役立つ一連の変数が含まれています。 現在の研究では、vCRF は言語モデルを検証するためのツールとして機能します。

eCREAM_LM の検証は、上記のように注釈が付けられた 1,000 件の臨床ノートのセットを使用して実行されますが、開発段階では使用されません。 これらのメモは、vCRF をコンパイルするタスクとともに eCREAM_LM モデルに送信されます。 専門医師と eCREAM_LM の間で vCRF を記入する際の一致が、eCREAM_LM の最終的な検証の尺度になります。

データの収集と匿名化

参加する各病院は、2021年から2023年の間に治療を受けた15万人から30万人の成人患者の医療記録に含まれるテキストメモを無料で提供する。 同じ患者のさまざまな側面(病歴、客観的検査、検査結果など)に言及したメモは互いに分離されるため、患者の完全なプロフィールを再構成することは不可能になります。 さらに、メモからは、患者に関する言及 (例: 名、姓、生年月日) および背景 (例: 病院、センターへの到着日時) が削除されます。 このプロセスにより、患者が再特定される可能性が最小限に抑えられ、患者の権利が最大限に保護されます。 データベース内で患者を再識別できる可能性は、その患者の特徴がデータベース内の他の個人とどの程度異なるかによって決まります。 固有の、つまり識別可能な患者がいる可能性は、データベースで利用可能な情報の量が増えるにつれて増加し、データベースのサイズが増えるほど減少します。 臨床メモからすべての個人情報と文脈情報を削除し、各メモを他のメモから分離することにより、各メモは患者のいくつかの特徴のみを報告します。 さらに、同じ国の病院から収集されたデータが統合され、言語ごとに 1 つの大規模なデータベースが作成されます。 これにより、メモから一意に識別できる個人が存在する確率が事実上ゼロになります。

最後に、メモに患者の親族の名前や電話番号などの第三者に関する情報が含まれる可能性を排除するために、フリーテキストから個人データを削除するために特別に設計された認定匿名化ソフトウェアが各病院にインストールされます。

匿名化されると、データは分析のために一元管理され、科学コミュニティの主要なヨーロッパ言語リソース共有プラットフォームにもアップロードされます。

統計分析

eCREAM_LM の検証では、vCRF に記入する際の専門の救急医師と eCREAM_LM 自体の間の一致を評価します。 データは、学習言語ごとに 1,000 件のメモのサンプルを参照します。 一致の尺度としてコーエンのκを使用して、vCRF の各変数の一致が評価されます。 Cohen の κ が 0.75 より大きい場合、eCREAM_LM は有効であると見なされます。

サンプルサイズ

vCRF を完了する際に、eCREAM_LM と経験豊富な救急医の間で優れた一致 (κ=0.80) が得られたと仮定すると、良好な一致を保証するのに十分な精度を達成するには、少なくとも 735 件のメモのサンプルが必要になります (信頼限界の下限は 95% 信頼区間)。コーエンのκは 0.75 より大きい)。 この数値は、変数ごとに異なる数のカテゴリ (2 ~ 5) と、バランスの取れた分布 (サンプルの 20% を含む 5 つのカテゴリなど) を含むサンプル内のカテゴリの異なる周辺分布を含むさまざまなシナリオの下で得られる最大サンプル サイズです。各カテゴリで)、非常に不均衡な結果(例:サンプルの 1.8%、7.3%、16.4%、29.1%、および 45.5% の 5 つのカテゴリ)。 一部のノートでは重要な情報が欠落している可能性があるため、1,000 個のノートに対してデータ検証評価を実行します。

研究の種類

観察的

入学 (推定)

300000

連絡先と場所

このセクションには、調査を実施する担当者の連絡先の詳細と、この調査が実施されている場所に関する情報が記載されています。

研究連絡先

研究連絡先のバックアップ

研究場所

      • Catania、イタリア
        • まだ募集していません
        • AOU Policlinico 'G.Rodolico - San Marco'
        • コンタクト:
      • Milan、イタリア
      • Milan、イタリア
        • まだ募集していません
        • ASST Grande Ospedale Metropolitano Niguarda
        • コンタクト:
      • Orbassano、イタリア
        • まだ募集していません
        • Ospedale San Luigi Gonzaga
        • コンタクト:
          • Valeria Caramello
          • 電話番号:v.caramello@sa +39 011 90261
      • Pozzuoli、イタリア
        • まだ募集していません
        • Ospedale Santa Maria delle Grazie
        • コンタクト:
      • Torino、イタリア
      • Vercelli、イタリア
        • 募集
        • Ospedale Sant'Andrea
        • コンタクト:
    • Milan
      • Milan、Milan、イタリア、20156
        • まだ募集していません
        • Istituto di Ricerche Farmacologiche Mario Negri IRCCS
        • コンタクト:

参加基準

研究者は、適格基準と呼ばれる特定の説明に適合する人を探します。これらの基準のいくつかの例は、人の一般的な健康状態または以前の治療です。

適格基準

就学可能な年齢

  • 大人
  • 高齢者

健康ボランティアの受け入れ

はい

サンプリング方法

確率サンプル

調査対象母集団

2021年1月1日から2023年12月31日までに参加救急外来に到着した成人患者全員

説明

包含基準:

  • アダルト
  • 2021年1月1日から2023年12月31日までの間に救急外来に到着した

除外基準:

  • なし

研究計画

このセクションでは、研究がどのように設計され、研究が何を測定しているかなど、研究計画の詳細を提供します。

研究はどのように設計されていますか?

デザインの詳細

コホートと介入

グループ/コホート
介入・治療
救急外来を受診した成人
介入なし

この研究は何を測定していますか?

主要な結果の測定

結果測定
メジャーの説明
時間枠
仮想症例報告フォームへの記入の一致
時間枠:1ヶ月
仮想症例報告フォームへの記入における専門医師と eCREAM_LM 言語モデル間の一致レベル
1ヶ月

協力者と研究者

ここでは、この調査に関係する人々や組織を見つけることができます。

捜査官

  • 主任研究者:Guido Bertolini、Istituto Di Ricerche Farmacologiche Mario Negri

研究記録日

これらの日付は、ClinicalTrials.gov への研究記録と要約結果の提出の進捗状況を追跡します。研究記録と報告された結果は、国立医学図書館 (NLM) によって審査され、公開 Web サイトに掲載される前に、特定の品質管理基準を満たしていることが確認されます。

主要日程の研究

研究開始 (実際)

2024年10月1日

一次修了 (推定)

2027年1月1日

研究の完了 (推定)

2027年9月1日

試験登録日

最初に提出

2024年1月26日

QC基準を満たした最初の提出物

2024年1月26日

最初の投稿 (実際)

2024年2月5日

学習記録の更新

投稿された最後の更新 (実際)

2026年7月15日

QC基準を満たした最後の更新が送信されました

2026年7月14日

最終確認日

2026年7月1日

詳しくは

本研究に関する用語

その他の研究ID番号

  • 8780

個々の参加者データ (IPD) の計画

個々の参加者データ (IPD) を共有する予定はありますか?

はい

IPD プランの説明

匿名化された個々の参加者データは、欧州言語グリッド リポジトリ (https://live.european language-grid.eu)、CLARIN 仮想言語観測所 (https: //vlo.clarin.eu/?2)、およびヨーロッパ言語平等 (ELE) イニシアチブ (https://european- language-equality.eu)。

IPD 共有時間枠

2025年12月以降

IPD 共有サポート情報タイプ

  • STUDY_PROTOCOL
  • CSR

医薬品およびデバイス情報、研究文書

米国FDA規制医薬品の研究

いいえ

米国FDA規制機器製品の研究

いいえ

米国で製造され、米国から輸出された製品。

いいえ

この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。

購読する