人工知能による乳癌早期発見の可能性の探求:AI支援マンモグラフィ解釈に基づくレトロスペクティブ多読影者研究(EARLIEST-AI) (EARLIEST-AI)
人工知能による早期乳がん検出の可能性の探求:AI支援マンモグラフィ解釈に基づく後ろ向きマルチリーダー研究(EARLIEST-AI)
EARLIEST-AI研究タイプ:単一診療所のデータに基づく、2相、マルチリーダー、盲検化後方視観察研究。
本研究の主目的は、過去の検査が利用できないシナリオにおいて、乳腺撮影検査の乳がん検出に対する放射線科医と人工知能(AI)の感度と特異度を評価し、AI支援の有無による放射線科医の診断性能を比較することである。
本研究の副次的目的は、コンピュータ支援検出(CAD)ソフトウェアの独立した診断性能(組織病理学的に確認された乳癌症例の特定における感度と特異度を含む)を評価すること、AI支援の有無による読影者間および読影者内変動性を評価すること、AI出力と組織病理学的所見の一致を評価すること、およびマンモグラムの技術的パラメータがAI性能に与える影響を評価することである。
期間:2012年1月1日から2024年12月31日までに実施されたマンモグラムから無作為に抽出されたサブセットのレビュー。画像所見は乳房画像報告・データシステム(BI-RADS)に従って分類された。
包含基準:
- 30歳以上の女性患者。
- 2012年1月1日から2024年12月31日までに1回以上のマンモグラムを実施。
- 以下の基準のいずれかを満たす:
3.1 マンモグラムから6ヶ月以内に乳がんの組織病理学的確定診断、3.2 または連続2回のマンモグラムでBI-RADS 1またはBI-RADS 2。
除外基準:
- 品質不良またはアーチファクトがあり信頼性のある評価ができないマンモグラム。
- 乳房形態を著しく変化させた乳房手術または乳がん治療の既往。
- データ欠損(以下を含む):
3.1. 過去の組織病理学データの欠如、3.2. または利用可能なフォローアップデータの欠如。
調査の概要
詳細な説明
提案研究の詳細な要約と正当化 予防的マンモグラフィは、無症状の女性に対して2年ごとに定期的に行われています。 予防的マンモグラフィ検査では、各女性に対して4枚の画像が撮影されます:2枚は頭尾(CC)方向、2枚は内外斜位(MLO)方向です。 毎回、マンモグラフィ検査は乳房画像報告データシステム(BI-RADS)を用いて評価されます。
Mammograaf Radioloogiakliinik(AS Mammograaf)での日常臨床では、マンモグラフィ検査の評価にBI-RADSシステムが使用されています。
病的変化のないマンモグラムにはBI-RADS 1スコアが割り当てられます。 BI-RADS 2スコアは、マンモグラムに良性変化があることを示します。
病的変化または悪性変化が疑われる場合、BI-RADS 3、BI-RADS 4、および/またはBI-RADS 5のスコアが割り当てられます。
BI-RADS 6は組織病理学的に確定した乳がんです。 Mammograaf Radioloogiakliinikでの日常臨床で使用されているマンモグラム閲覧プロトコルを以下に示します。
スクリーニングマンモグラムは常に2人の放射線科医によって独立して評価されます。 言い換えれば、スクリーニングマンモグラムの日常評価は独立二重読影プロトコルを用いて行われます。 2人の放射線科医がマンモグラムを独立して評価し、BI-RADS 1および/またはBI-RADS 2の評価を与えた場合、これは盲検コンセンサスと見なされ、患者がさらなる検査を必要としないことを示します - すなわち、マンモグラムに不明瞭な変化や悪性を示す変化はありません。 BI-RADS 3、4、5の症例では、非盲検コンセンサス読影が使用され、放射線科医が既存の診断と同僚との症例討議に基づいてマンモグラムを一緒にレビューし、コンセンサスに達します。 主任研究者と研究に参加する経験豊富な読者の日常業務には、以前のマンモグラムの評価、複雑な症例の分析、間欠癌の検出が含まれます。 評価プロセスの主観性を減らすために、特別な閲覧戦略が使用されます。
そのような方法の1つが、いわゆる盲検レビューであり、病理領域の位置を知らずに以前のマンモグラムをレビューし、後知恵効果(遡及的バイアス)を回避します。
統計的に有意な差を得るためには、コホートは読者に過度の負担を与えずに十分な大きさでなければなりません。
Mammograaf Radioloogiakliinikの乳房放射線科医の通常の作業プロセスは次のようになります。
経験豊富な放射線科医の通常の作業ペースでは、作業の質を低下させることなく1日あたり最大500枚のマンモグラムを評価できます。 経験の浅い放射線科医の場合、最適な作業負荷は1日あたり最大200枚のマンモグラムです。
日常業務で人工知能を使用するには、放射線科医がそれに慣れ、スキルを持ち、プロセスを理解する必要があります。
人工知能との1.5年の経験から、3つの注目すべき側面が特定されました。
人間の認知エラー 放射線学では、人工知能システムと協働する際に2つの主要な認知エラーが発生する可能性があります:確証バイアスとアンカリングです。 これらのエラーの現れ方は、放射線科医がまずマンモグラムを見てから人工知能のマーキングを見るか、あるいは逆の順序で始めるかによって異なります。
編集されたデータセットをレビューするプロセスは、そのようなエラーが日常診療でどの程度現れるか、そしてどの読影シナリオが日常業務に最も適しているかを評価できるように構成されています。
人工知能によるマンモグラム上の条件付き偽陽性マーキング 人工知能システムと協働する際、経験豊富な放射線科医がBI-RADS 1またはBI-RADS 2と分類したマンモグラムに、システムが高または中リスクのマーキングを割り当てる偽陽性マーキングが観察されました。
現在常に最終決定は放射線科医にあることを考慮すると、専門家によるマンモグラムの評価と矛盾する場合は、人工知能のマーキングはしばしば無視されます。
2024年、Mammograaf RadioloogiakliinikでのHera人工知能の感度は94.5%でした:スクリーニング中に合計138例のがんが診断され、そのうち131例はHera人工知能によってもマークされました。
Hera AIの特異度は2つの方法で評価できます:
- オプション1:約2年後に、2024年の結果を遡及的に分析する。
- オプション2:この研究の枠組みで作成されたデータセットを分析する。このデータセットには、BI-RADS 3、BI-RADS 4、およびBI-RADS 5のマンモグラムと、BI-RADS 1および/またはBI-RADS 2の評価が反復スクリーニングで確認された可視病理のないマンモグラムの両方が含まれています。
後者のオプションが望ましく、近い将来にいわゆる偽陽性ラベルにどのように対処するかをよりよく理解できる可能性があります。 現在、それらに対する態度は主観的であり、放射線科医の性格と解釈スタイルに大きく依存しています。
マンモグラムの技術的品質。 日常診療では、乳房のポジショニングやマンモグラム撮影時に加えられる圧力などのパラメータが、画質と放射線科医およびAIのパフォーマンスの両方に影響を与えることが観察されています。 この研究は、技術的パラメータとAIの感度および特異度の関係を客観的に評価する機会を提供します。
この研究の計画において、3つの仮説が策定されました。
- 仮説1:AIサポートの使用により、現在の放射線科医の判断に基づく実践と比較して、より早期の段階で乳がんを診断できる。
- 仮説2:AIの推奨に対する放射線科医の態度は、その経験に依存する。
- 仮説3:マンモグラムの技術的パラメータは、AIの特異度と感度に有意に影響する。
研究スケジュール この研究は2段階のデザインで、複数の読者と複数の読影セッションが含まれます。 2つのフェーズ間に休憩期間が計画されています。
研究スケジュールは以下の通りです:
- 初期データ収集:2ヶ月
- 読影セッション:3×2ヶ月
- 読者休憩期間:1ヶ月
- 統計解析と結論の形式化:3ヶ月 したがって、研究の予想総期間は12ヶ月です。 研究活動は2025年10月に開始する予定で、12ヶ月間続きます。
個人データは2026年1月1日頃に削除され、その後は完全に匿名化されたデータのみがさらなる科学分析のために保持されます。
被験者とその募集方法の詳細な説明
遡及的研究であり、その枠組みでマンモグラムを含む匿名データセットが編集されます。
すべてのマンモグラムはMammograaf Radioloogiakliinikで実施されました。 データセットは1000セットのマンモグラフィで構成され、各セットには1人の女性の4枚の画像が含まれます:左右乳房の頭尾(CC)と内外斜位(MLO)画像。
- BI-RADS 6症例に関連するマンモグラムのリストを作成し、匿名化前に以下のデータを入力:患者IDコードと年齢、診断に関連するマンモグラムの日付、がんの種類(浸潤性乳管がん、浸潤性小葉がん、乳管がん in situ、エストロゲン受容体(ER)、プロゲステロン受容体(PR)、ヒト上皮成長因子受容体2(HER2)受容体ステータスとKi-67増殖指数の生検結果、マンモグラムのBI-RADSスコア。
- BI-RADS 6症例に関連しないマンモグラムのリストを作成し、匿名化前に以下のデータを入力:患者IDコードと年齢、データセットに含まれるマンモグラムの日付、マンモグラムのBI-RADSスコア。
- BI-RADS 6症例からなる放射線学的ゴールドスタンダードを作成する。 この研究では、BI-RADSスコアに加えて、可能性のある所見の関心領域(ROI)も求められます。 そのようなタスクを実行するために、100枚のマンモグラムのデータセットをレビューするのに経験豊富な放射線科医は約30分かかると想定され、一方経験の浅い放射線科医には60〜90分かかると推定されます。
この負担は日常業務に重大な障害や中断を引き起こしません。
非がんマンモグラムについては、その後のスクリーニングで陰性評価(BI-RADS 1または2)が確認された症例のみが含まれました。
データセットに含まれる各マンモグラフィ研究について、臨床業務で決定された対応するBI-RADS評価がプロトコルに記録され、研究の透明性と信頼性が確保されます。
統計的有意性は、参照テスト(AIサポートなしでの読影)と評価テスト(AIサポートありでの読影)の感度の期待差に基づいて計算されます。 参照テストの推定感度は0.85、評価テストの感度は0.90です。 標本サイズの推定には二群の比率のZ検定が使用されます。 望ましい統計的検出力はp=0.90、有意水準α=0.05です。 これらのパラメータに基づき、標本サイズは914と計算され、研究では1000例に切り上げられます。
マクネマー検定に基づく計算(感度90%対87%、α=0.05、検出力0.90、有病率約30%)では、最小標本サイズが876と示され、統計的検出力が低下するリスクを避けるために控えめに1000に切り上げられました。
この理由から、1000枚のマンモグラムからなるデータセットが構築されました。 この研究では、独立した生物統計家の意見を求める可能性が検討されています。
- 読者の専門的経験
この研究の枠組みにおいて、専門家という用語は次のように定義されます:乳放射線学の分野で日常的に働く放射線科医で、マンモグラムの評価、乳房超音波検査の実施、超音波および/または磁気共鳴画像ガイド下での生検の実施、および乳房MRI検査の記述を含みます。 専門家は以下の要件を満たすスペシャリストと見なされます:
- 乳放射線学における少なくとも10年の臨床経験、
- 年間少なくとも12,000件のマンモグラフィ検査の読影量、
- 少なくとも12ヶ月間の人工知能の使用に関する日常業務経験。
主任研究者は、約20年のマンモグラフィ検査評価経験を持つ乳房放射線科医であり、過去5年間で77,000件以上のマンモグラフィ検査を評価しており、平均年間15,000件以上の検査です。 さらに、主任研究者は乳房超音波検査を実施し、超音波とMRIの両方のガイド下で生検を行い、乳房磁気共鳴画像検査を記述します。 また、主任研究者はマンモグラフィの解釈における人工知能の使用について18ヶ月の日常業務経験を持っています。 さらに、主任研究者は少なくとも7年間、マンモグラフィ検査のポジショニング品質を日常的に評価してきました。
主任研究者は、データセットの編集とゴールドスタンダードの検証において専門家として行動します。
- 読者1:マンモグラフィ研究の評価における約30年の経験を持ち、過去5年間で76,000件以上のマンモグラフィ研究を評価しており、平均年間15,000件以上の研究です。
- 読者2:マンモグラフィ研究の評価における約10年の経験を持ち、過去5年間で31,000件以上のマンモグラフィ研究を評価しており、平均年間6,000件以上の研究です。
- 読者3:マンモグラフィ研究の評価における約1年の経験を持ち、過去1年間で4,324件のマンモグラフィ研究を評価しています。
- 読者4:マンモグラフィ研究の評価における1年未満の経験を持ち、過去1年間で2,963件のマンモグラフィ研究を評価しています。
- 読者5:マンモグラフィ研究の評価における1年未満の経験、過去1年間で2,242件のマンモグラフィ研究を評価しています。
読者の異なる経験レベルは、この研究を実施する上で重要です。 これにより、人工知能が提案する所見の解釈が異なる経験レベルの放射線科医に与える影響を評価し、第2の仮説を確認または反駁するかを調査することができます。
研究方法論の詳細な説明 データセットの戦略、プロセス、データ分析は、評価の独立性を維持し認知バイアスを避けるために、意図的に読者から隠されています。 研究手法全体はプロトコル(セクション6、セクション7、セクション12)に文書化されており、対応する情報は閲覧フェーズ終了後に参加者に開示されます。
このようなデータセットは、臨床情報や以前の研究なしに1回のマンモグラフィ検査のみが利用可能なシナリオにおいて、読者とAIの限定情報下で乳がんを検出する能力を評価することを可能にします。
プロトコルのセクション6.2.1で提供される情報に基づき、このデータセットの構成により第1の仮説に対する回答を得ることができます。
このようなデータセットにより、以下の質問に定量的な回答を提供することができ、第2および第3の仮説に対応することが保証されます。
- AIベースのCADシステムの特異度と感度は?
- 人間の読者の特異度と感度は?
- CADの手がかりは人間の読者のパフォーマンスに影響するか?
- 人間の読者のパフォーマンスは、CADの手がかりが提示されるタイミング(閲覧の開始時または読者の初期評価後)に依存するか?
- 人間の読者とAIベースのCADシステムの診断パフォーマンスに影響する要因は何か?
特に:
- 読者関連因子:経験のレベル
- 患者関連因子:年齢、乳房密度
- 悪性プロセスの特性評価:腫瘍の種類、グレード、サイズ、1つまたは両方の投影(CCおよび/またはMLO)での可視性
- マンモグラムの技
研究の種類
入学 (実際)
連絡先と場所
研究場所
-
-
Harju
-
Tallinn、Harju、エストニア、13214
- Mammograaf Radioloogiakliinik
-
-
参加基準
適格基準
就学可能な年齢
- 大人
- 高齢者
健康ボランティアの受け入れ
サンプリング方法
調査対象母集団
説明
選択基準:
- .
除外基準:
- .
研究計画
研究はどのように設計されていますか?
デザインの詳細
コホートと介入
グループ/コホート |
|---|
|
BI-RADS 1-2 患者
|
|
BI-RADS 6の患者
|
この研究は何を測定していますか?
主要な結果の測定
結果測定 |
時間枠 |
|---|---|
|
スタンドアロンリーダーの感度
時間枠:研究完了まで、平均1年間
|
研究完了まで、平均1年間
|
|
独立型CAD感度
時間枠:「研究終了まで、平均1年間」
|
「研究終了まで、平均1年間」
|
|
<usertag>拡張リーダー感度</usertag>
時間枠:研究完了まで、平均1年
|
研究完了まで、平均1年
|
|
スタンドアローンリーダー検出から診断までの時間(MAE)
時間枠:研究完了まで、平均1年間
|
研究完了まで、平均1年間
|
|
診断までの拡張読み取り検出時間(MAE)
時間枠:研究完了まで、平均1年間
|
研究完了まで、平均1年間
|
二次結果の測定
結果測定 |
メジャーの説明 |
時間枠 |
|---|---|---|
|
読者間一致
時間枠:研究完了まで、平均1年
|
研究完了まで、平均1年
|
|
|
リーダー内一致
時間枠:研究完了時まで、平均期間は1年
|
研究完了時まで、平均期間は1年
|
|
|
適応症の再評価 - 独立したリーダー特異性(スタンドアロンダさ5...standalone reader specificity'
時間枠:研究完了まで、平均1年間
|
研究完了まで、平均1年間
|
|
|
拡張されたリーダー特異性
時間枠:研究終了まで、平均1年間
|
研究終了まで、平均1年間
|
|
|
スタンドアローンリーダー領域別注釈精度マーク
時間枠:試験完了まで、平均1年間
|
本研究の目的のために、読者に対する関心領域(ROI)の重なりを以下のように定義します:
|
試験完了まで、平均1年間
|
|
拡張リーダー領域別注釈精度
時間枠:研究完了まで、平均1年間
|
この研究の目的のために、読者における関心領域(ROI)の重なりを以下のように定義します:
|
研究完了まで、平均1年間
|
協力者と研究者
協力者
捜査官
- 主任研究者:Marina Astapova, MD、Mammograaf Radioloogiakliinik
研究記録日
主要日程の研究
研究開始 (実際)
一次修了 (実際)
研究の完了 (推定)
試験登録日
最初に提出
QC基準を満たした最初の提出物
最初の投稿 (実際)
学習記録の更新
投稿された最後の更新 (実際)
QC基準を満たした最後の更新が送信されました
最終確認日
詳しくは
この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。