変性疾患に対する腰椎固定術後の結果の予測 (FUSE-ML)
変性疾患に対する腰椎固定術後の結果を予測するための国際的な多施設機械学習アルゴリズムの開発と外部検証: FUSE-ML 研究
調査の概要
詳細な説明
はじめに 腰痛は、西洋社会における身体障害の上位 3 つの原因の 1 つであり、直接的および間接的な重大な社会経済的コストを課しています。 放射性脚痛を伴うまたは伴わない腰痛の病因は多因子性ですが、多くの場合、変性椎間板疾患 (DDD) または脊椎すべり症に関連しています。 症候性脊椎すべり症または長期の保存的治療に反応しない患者の進行性 DDD の標準治療は椎体間固定ですが、これには議論の余地があります。 保存的治療に比べて効果がないという報告もあり、患者の選択は非常に重要です。 さまざまな予後検査が、手術から最も恩恵を受ける可能性のある患者のサブセットを特定しようと試みていますが、これらの検査の妥当性は不明です。 最終的に、このカテゴリーの患者における成功は、処置の技術的な成功ではなく、身体症状の改善 (患者報告アウトカム指標 [PROM]) によって定義されるべきです。 難治性で保存療法に抵抗性の腰椎変性疾患患者の適切な割合が、最終的に腰椎固定手術から利益を得ています - 難しい問題は、それらを確実に特定し、不必要で失敗した手術を避ける方法です.
文献では、腰椎変性疾患患者のいくつかのサブセットが特定されており、腰椎固定術から他の患者よりも多くの利益を得る可能性があります。 不十分な転帰のリスクが高い患者を術前に正確に特定することは、臨床的に有利である.不満足な結果。 しかし、臨床医が各有害事象について説明されている多くの単一の危険因子のバランスをとって、個々の患者の個別化されたリスクと利益のプロファイルに到達することは、多くの場合不可能です。
機械学習 (ML) 手法は、多くの臨床患者変数を各患者に合わせた 1 つの総合的なリスク予測に統合するのに非常に効果的です。 古典的な統計に基づく 1 つの多施設モデルは、すでに Khor らによって説明されています。 - しかし、外部検証の結果、信頼性が低く、校正が不十分であることが判明しました。 また、このモデルは比較的少数の ML 患者に基づいていました。 FUSE-ML 研究の目的は、さまざまな国際センターからの多施設データに基づいて、堅牢な ML ベースの予測ツールを開発し、外部で検証することです。このツールは、変性疾患のために腰椎固定術を受けている各患者に合わせた個別のリスクと利益のプロファイルを提供します。 .
方法の概要 データは、さまざまな国際センターによって収集されます。 全体として、モデルは構築され、個々の予後または診断のための多変数予測モデル (TRIPOD) ガイドラインの透明性のあるレポートに従って編集されます。 以下に詳述する関連する結果ごとに 1 つのモデルが作成されます。
チューリッヒ大学 (V.E. Staartjes, C. Serra) は、この研究のスポンサーです。
倫理的考慮事項 各センターは、独自の倫理委員会/治験審査委員会 (IRB) の承認と、データ転送契約 (DTA) の確立に責任を負います。 スポンサー (チューリッヒ大学) は、要求に応じて標準の DTA を提示します。 彼らは、遡及的または将来のデータ収集と、完全に匿名化されたデータのスポンサーとの共有について承認を得る必要があります。 スポンサーは、この詳細な研究プロトコルを提供することで支援できます。 すべての研究手順は、ヘルシンキ宣言とその修正に従って実施されます。
包含および除外基準 胸腰椎椎弓根スクリューの配置に関する以下の適応症を有する患者は、包含のために考慮されます:神経根障害、偽関節症)。 主な適応症として、感染症、脊椎腫瘍、外傷性および骨粗鬆症性骨折、または脊柱側弯症または脊柱後弯症の変形手術を受けている患者は適格ではありません。 中等度または重度の脊柱側弯症の患者(コロナコブの> 30度/シュワブ分類の矢状修飾子+または++)は適格ではありません。 6つ以上の椎骨レベルで手術を受けている患者も適格ではありません。 12 か月でエンドポイント データが欠落している患者は除外されます。 患者はインフォームドコンセントを与える必要があります。 18 歳以上の患者のみが対象と見なされます。
データ収集 各センターは、遡及的に、将来のレジストリから、または遡及的に収集された変数によって補足された将来のレジストリからデータを収集します。 各センターは、研究に含まれる完全な 12 か月の追跡データを含む最低 100 人の患者に貢献する必要があります。 標準化された Excel データベースは、匿名のデータ入力用にスポンサーによって提供されます。 データは、標準化され匿名化された形式で入力されます。 この Excel データベースには、研究固有の患者番号のみが含まれます。 各センターは、必要に応じて、研究固有の患者番号をセンター固有の患者番号にさかのぼることができる内部スプレッドシートを保持します。 スポンサー機関への完全なデータの提出期限は、2021 年 8 月 13 日です。
オーサーシップ センターは、研究に含めるために、合計で完全な結果データを含む少なくとも 100 のケースを提供する必要があります。 各参加センターは、著者リストに含める最大 4 名の著者を指定できます。 その他のセンター固有の貢献者は、FUSE-ML 研究グループの正会員としてリストされ、PubMed / Medline の完全な貢献者ステータスが付与されます。 スポンサー機関には、利用可能な6つの主要著者のポジションがあります。
主要なエンドポイントの定義
いくつかのエンドポイントが評価されます。
- 1. 12 か月のオスウェストリー障害指数 (ODI)。
- 2. 12 か月後の背中の痛みの視覚的アナログ スケール (VAS-BP、0 ~ 100)。 これは、0 ~ 10 の変換された数値評価尺度 (NRS)、または 0 ~ 100 に変換された 0 ~ 10 の VAS にすることもできます。
- 3. 12 か月での脚の痛みの視覚的アナログ スケール (VAS-LP、0 ~ 100)。 これは、0 ~ 10 の変換された数値評価尺度 (NRS)、または 0 ~ 100 に変換された 0 ~ 10 の VAS にすることもできます。
これらの結果は、Ostelo らによると、臨床的に重要な最小差 (MCID) を使用して二分されます。 したがって、ベースラインと比較した特定のスコアの 30% 以上の改善は、その特定のスコアでの MCID (臨床的成功) の達成と見なされます。 患者が最初に (ODI、NRS-BP、または NRS-LP のいずれかで) 症状を示さず、そのスコアでゼロのままであった場合、これはそのスコアの MCID としても定義されます。
機能とその定義
すべての機能は、術前に測定または推定されます。 エンドポイントに加えて、次の入力フィーチャが収集されます。
- 年齢(歳)
- 性別(男女)
以下の手術適応症の存在(該当するものをすべて選択してください):
- 脊椎すべり症
- (再発)椎間板ヘルニア
- 神経根症
- 慢性腰痛 (CLBP) / 変性椎間板疾患 (DDD)
- 失敗した背中の手術症候群 (FBSS)
- 腰部脊椎管狭窄症
- 偽関節症
- 指数レベル (該当するものをすべて選択してください。T12 - S1)
- 高さ (cm)
- 重量 (kg)
- BMI (kg/m2)
- 喫煙状況 (喫煙中 / 禁煙 / 未喫煙)
- 術前(ベースライン)ODI
- 術前(ベースライン)VAS-BP
- 術前(ベースライン)VAS-LP
- 米国麻酔学会 (ASA) スコア (1-2 / 3 以上)
- オピオイド鎮痛薬の術前使用 (はい/いいえ)
- 併存疾患としての肺性喘息(はい/いいえ)
- 以前の胸腰椎手術 (はい/いいえ)
- 人種・民族(白人・黒人・アジア人・その他)
- 外科的アプローチ (該当するものをすべて選択してください: TLIF / PLIF / ALIF / 側方)
- ペディクルスクリューの挿入(はい/いいえ)
- 低侵襲技術 (はい/いいえ)
サンプルサイズ 何百万人もの患者を含む最大のコホートでさえ、関連する入力変数が含まれていない場合 (「ガベージイン、ガベージアウト」-年齢、性別、およびボディマス指数)、予測パフォーマンスとサンプルサイズの関係は、特にデータを大量に消費する一部の ML アルゴリズムでは、確かに正比例します。 臨床予測モデルの一般化を確実にするために、サンプルサイズは患者集団を十分に代表するものでなければならず、アルゴリズムの複雑さを考慮に入れる必要があります。 たとえば、ディープ ニューラル ネットワーク (非常に複雑なモデルの例) では、多くの場合、数千人の患者が収束する必要がありますが、ロジスティック回帰モデルでは、わずか数百人の患者で安定した結果が得られる場合があります。 さらに、入力変数の数も影響します。 大まかに言えば、関係をモデル化するには、含まれる入力変数ごとに最低でも 10 個の正のケースが必要であると言えます。 多くの場合、サンプル サイズがこの経験則で計算されるよりも小さい場合、モデルの不安定な動作と分割間のパフォーマンスの大きな分散が観察されます。 最も重要なのは、結果を経験する患者の割合です。 非常にまれなイベントの場合、結果として、はるかに大きな合計サンプル サイズが必要になります。 たとえば、上記の経験則によると、10 の入力特徴に基づいて 10% の症例のみで発生する結果を予測するには、結果を経験した少なくとも 100 人を含む少なくとも 1000 人の患者が必要です。 一般的に、また個人的な経験から、結果の希少性に関係なく、陽性ケースが 100 未満で、合計でかなり多いケースを持つコホートで ML モデルを開発することはお勧めしません。 また、関心のある結果の危険因子に関する入手可能な文献を検討することもできます。疫学的研究で結果との関連性が弱いことが判明した場合、より多くの患者が良好な予測性能を持つモデルに到達する必要がある可能性があります。いくつかの高度に関連する危険因子を伴う結果であり、予測が容易な場合があります。 また、サンプルサイズが大きいほど、トレーニングまたは検証専用の患者データを大量に使用して、より寛大な評価が可能になり、通常はより優れたキャリブレーション測定が得られます。
20% から 40% の患者が、脊椎固定後に臨床的に意味のある改善を報告していません (少数派)。 サンプルサイズの計算では、著者は控えめに見積もるために 20% を採用しています。 したがって、この研究では、著者の専門知識と上記の経験則に基づいて、著者は、一般化可能な特徴関係を抽出するために、否定的な結果 (少数派クラス) を持つ最低 200 人の患者が必要であると推定しています。 上記で説明したように推定発生率は約 20% であり、トレーニングには最低でも約 1000 人の患者が必要であることを意味します。 外部検証でのキャリブレーションの適切な評価のために、著者はさらに 300 人の患者が必要になると見積もっています (したがって、約 60 人の患者が肯定的な結果を得ています)。 したがって、合計で、著者は、堅牢なモデルに到達するには最低 1300 人の患者が必要であると推定しています。 データが多いほど、パフォーマンスが向上し、キャリブレーションが向上する可能性があります。
予測モデリング KNN インピュターは、モデルの将来のアプリケーションで発生する可能性のある欠落データを補完するように共同トレーニングされます。 トレーニング セットに欠損データがある場合は、前述の KNN インピューターを使用して補完されます。 欠損値が 25% を超える機能または患者は除外されます。 データは標準化され、ワンホット エンコードされます。 上記のエンドポイントで予想される主要なクラスの不均衡の場合、ランダム アップサンプリングまたは合成少数オーバーサンプリング (SMOTE) がトレーニング セットに適用されます。 すべての機能は、最初にトレーニングのためにモデルに提供されます。 必要に応じて、作成者は再帰的特徴除去 (RFE) を適用して、トレーニング データの入力特徴を選択します。
著者は、次のバイナリ分類アルゴリズムを試します: 一般化線形モデル (GLM)、一般化加法モデル (GAM)、確率的勾配ブースティング マシン (GBM)、単純ベイズ分類器、単純な人工ニューラル ネットワーク、サポート ベクター マシン (SVM)、およびランダムフォレスト。 各モデルは完全にトレーニングされ、必要に応じてハイパーパラメーターが調整されます。 最終的なモデルは、AUC、感度、特異性、およびリサンプリングされたトレーニング パフォーマンスのキャリブレーション メトリックに基づいて選択されます。 トレーニングは、10 回の繰り返しで繰り返される 5 分割交差検証で行われます。
その後、1 つの最終モデルが外部検証データで 1 回だけ評価されます。 外部検証指標の 95% 信頼区間は、ブートストラップを使用して導出されます。
バイナリ分類のしきい値は、AUC ベースの「(0,1) に最も近い基準」または Youden のインデックスを使用してトレーニング データのみで識別され、感度と特異性の両方を最適化するか、トレーニング セットで最適化されます。臨床的意義に基づく(除外モデル)。 すべての分析は、R バージョン 4.0.2 以降で実行されます。
評価 分類モデルのパフォーマンスは、モデルの識別とキャリブレーションという 2 つの側面に沿って大まかに判断できます。 識別という用語は、特定の患者が特定の結果を経験するかしないかを正しく分類する予測モデルの能力を表します。 したがって、弁別は二値予測の正確さを説明しました - はいまたはいいえ。 ただし、キャリブレーションは、モデルの予測確率 (0% から 100% の範囲) が実際に観察されたバイナリ エンドポイント (真の事後) の発生率に対応する程度を表します。 多くの出版物では、キャリブレーション メトリクスを報告していませんが、これらは十分にキャリブレーションされた予測確率 (例: 合併症を経験する予測確率は 18% です) は、多くの場合、臨床医と患者にとってはるかに価値があります! - バイナリ予測よりも (例: 合併症を経験することはないでしょう)。
リサンプリングされたトレーニングのパフォーマンスと外部検証セットのパフォーマンスは、識別とキャリブレーションのために評価されます。 識別に関しては、著者は AUC、精度、感度、特異性、陽性適中率 (PPV)、陰性適中率 (NPV)、および F1 スコアを評価します。 校正に関しては、著者は Brier スコア、期待観測 (E/O) 比、校正勾配と切片、Hosmer-Lemeshow 適合度検定、および両方の校正プロットの目視検査を評価します。データセットも出版物に含まれます。
解釈可能性 解釈可能性のための方法の程度と選択は、最終的に選択されたアルゴリズムに依存します。 一部のアルゴリズムは、どの要因がどのように結果に影響を与えるかについて、ネイティブに説明を提供できます。 したがって、例えばGLM、GAM、または単純ベイズ分類器が選択されている場合、パラメーター/部分依存値が提供されます。 単純な決定木については、意思決定プロセスの図を提供できます。 ニューラル ネットワークや確率的勾配ブースティング マシンなど、より複雑な他のモデルでは、そのような説明をネイティブに提供することはできません。 その場合、著者は、AUC ベースの変数の重要度と、LIME の原則を使用したモデルに依存しない変数の重要度のローカル解釈の両方を提供します。
期待される結果 著者らは、少なくとも 0.70 の AUC で一貫して予測する可能性が高く、十分に調整された多施設国際データに基づく一般化可能なモデルに到達することを期待しています。 光沢のある環境を使用して、2 つのモデルのそれぞれに対して Web ベースの予測ツールも作成されます。 https://neurosurgery.shinyapps.io/impairment (例: Staartjes et al., Journal of Neurosurgery, 2020 も参照)。 この Web ベースのアプリは、インターネット対応デバイス (モバイルまたはデスクトップ) で無料で利用でき、サーバーベースのコンピューティングにより、ほとんどのデバイスで安定しているはずです。 サーバーの維持費はスポンサーが負担します。 収集されたデータは、スポンサーによって 10 年間保管されます。 大規模なデータセットは、さらなる分析のために公開され、合理的な要求に応じて、他のすべてのセンターによる承認後に、貢献しているセンターに提供されます。 目標は、収集されたデータセットを使用して他の分析を有効にすることです。 追加の分析が出版につながる場合、すべての寄稿者が共著者として含まれ、すべての共著者はその原稿を事前に確認する機会があります。 貢献する研究センターは、独自のデータを含むその後の分析の公開を拒否する権利を有します。
研究の種類
入学 (実際)
連絡先と場所
参加基準
適格基準
就学可能な年齢
健康ボランティアの受け入れ
受講資格のある性別
サンプリング方法
調査対象母集団
説明
- 包含基準:
- -変性病状(以下の1つまたは複数:脊柱管狭窄症、脊椎すべり症、変性椎間板疾患、再発性椎間板ヘルニア、失敗した背中の手術症候群(FBSS)、神経根障害、偽関節症)。
- 患者はインフォームドコンセントを与える必要があります。
- 18 歳以上の患者のみが対象と見なされます。
除外基準:
- 主な適応症として、感染症、脊椎腫瘍、外傷性および骨粗鬆症性骨折、または脊柱側弯症または脊柱後弯症の変形手術を受けている患者は適格ではありません。 中等度または重度の脊柱側弯症の患者(コロナコブの> 30度/シュワブ分類の矢状修飾子+または++)は適格ではありません。
- 6つ以上の椎骨レベルで手術を受けている患者も適格ではありません。
- 12 か月でエンドポイント データが欠落している患者は除外されます。
研究計画
研究はどのように設計されていますか?
デザインの詳細
この研究は何を測定していますか?
主要な結果の測定
結果測定 |
メジャーの説明 |
時間枠 |
|---|---|---|
|
背中の痛みのためのビジュアル アナログ スケール
時間枠:手術後12ヶ月
|
0 から 100 までの背中の痛みの重症度に対する Visual Analogue Scale (VAS)。スコアが高いほど痛みが強いことを示します。
|
手術後12ヶ月
|
|
脚の痛みのためのビジュアル アナログ スケール
時間枠:手術後12ヶ月
|
0 から 100 までの脚の痛みの重症度に対する Visual Analogue Scale (VAS)。スコアが高いほど痛みが強いことを示します。
|
手術後12ヶ月
|
|
オスウェストリー障害指数
時間枠:手術後12ヶ月
|
主観的機能障害の Oswestry Disability Index (ODI) (0 ~ 100、値が高いほど機能障害のレベルが高いことを示す)
|
手術後12ヶ月
|
協力者と研究者
スポンサー
捜査官
- スタディディレクター:Marc L Schröder, MD PhD、Bergman Clinics
研究記録日
主要日程の研究
研究開始 (実際)
一次修了 (実際)
研究の完了 (実際)
試験登録日
最初に提出
QC基準を満たした最初の提出物
最初の投稿 (実際)
学習記録の更新
投稿された最後の更新 (実際)
QC基準を満たした最後の更新が送信されました
最終確認日
詳しくは
この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。