このページは自動翻訳されたものであり、翻訳の正確性は保証されていません。を参照してください。 英語版 ソーステキスト用。

乳がん超音波AI解釈のベンチマーク構築とマルチモーダルAIモデルの性能評価 (BUST-AI Bench)

2026年3月24日 更新者:Qingli Zhu、Peking Union Medical College Hospital

ACR BI-RADS v2025基準に基づくマルチモーダル人工知能モデルの体系的パフォーマンス評価と知能型乳房超音波画像解釈の標準化ベンチマーク評価システム構築

この単一施設による後ろ向き観察研究は、インテリジェント乳房超音波画像解析のための標準化されたベンチマーク評価システムを構築し、現在主流のマルチモーダル人工知能(AI)モデルの診断性能を体系的に評価することを目的としています。

病理診断が確定した匿名化されたBモード乳房超音波画像を施設アーカイブ(2018-2025年)から後ろ向きに収集し、公開オープンアクセスデータセットの画像で補完します。 経験レベルが異なる専門放射線科医が、米国放射線学会(ACR)乳房画像報告・データシステム(BI-RADS)v2025基準に従って、腺組織構成、病変特性(腫瘤性病変と非腫瘤性病変)、形態学的記述、最終BI-RADS分類を含め、すべての画像を独立して注釈付けします。

ベースライン深層学習モデル(CNNベースのResNet-50とTransformerベースのUSFM)を訓練し、パフォーマンスベースラインを確立し、クロスアーキテクチャコンセンサスを通じて診断難易度による症例層別化を行います。 次に、汎用モデルと医療領域モデルを含む複数のマルチモーダル大規模言語モデル(MLLM)を、再現性のために温度0でBI-RADS誘導思考連鎖プロンプトを使用した標準化API呼び出しを通じて評価します。

主要評価項目には、BI-RADS分類精度と良性・悪性鑑別の診断AUCが含まれます。 モデルの堅牢性と安全性は、分布外拒否テスト、温度安定性実験、思考モードアブレーション研究を通じて評価されます。 本研究はFLAIRおよびTRIPOD-LLM報告ガイドラインに準拠しています。

調査の概要

詳細な説明

背景:乳がんは世界中の女性において最も罹患率の高い悪性腫瘍です。 超音波検査は第一線のスクリーニング手法であり、特に乳房組織が高濃度でマンモグラフィーの感度が限られるアジア人集団において有用です。 しかし、超音波所見の解釈は検査者への依存性が非常に高く、特にカテゴリー4A-4B病変におけるBI-RADS分類では観察者間の変動が顕著です。 マルチモーダル大規模言語モデル(MLLMs)は、ゼロショット診断能力、解釈可能な思考連鎖推論、構造化レポート生成により、医療画像解析の有望なツールとして登場しました。 それにもかかわらず、現時点では乳がん超音波所見解釈におけるAI性能を評価する標準化されたベンチマークは存在しません。

研究デザイン:約1,380枚の乳がん超音波画像を選定します(評価セット1,200枚+分布外安全性テストセット150枚+プロンプト開発セット30枚)。これらは3つの診断カテゴリーを含みます:正常乳房、良性病変(BI-RADS 2-4B)、悪性病変(BI-RADS 3-5)。 経験年数5年未満の若手放射線科医2名と経験年数15年以上の上級放射線科医2名が、ACR BI-RADS v2025に基づき画像を独立して注釈付けし、不一致症例については第5の専門家による調停を行います。

診断難易度は、クロスアーキテクチャ深層学習コンセンサスを用いて3段階に層別化されます:Tier 1(明瞭、両モデル正解)、Tier 2(疑わしい、片方正解/片方不正解)、Tier 3(困難、両モデル不正解、上級専門家による検証あり)。 MLLMsは複数の次元で評価されます:分類精度、感度、特異度、F1スコア、AUC、専門家コンセンサスとのコーエンのカッパ一致度、期待校正誤差(ECE)、形態的特徴記述精度、思考連鎖推論の質。

安全性評価:(1)150枚の非診断画像(画質劣化画像、非乳房超音波、他の画像モダリティ)を用いた分布外拒否テスト;(2)パラメータ設定にわたる温度安定性事前実験;(3)標準推論モードと思考連鎖推論モードを比較する思考モードアブレーション。 すべての実験は固定モデルスナップショット、システムフィンガープリント監視、再現性のための完全なログ記録を使用します。

研究の種類

観察的

入学 (推定)

1380

連絡先と場所

このセクションには、調査を実施する担当者の連絡先の詳細と、この調査が実施されている場所に関する情報が記載されています。

研究連絡先

  • 名前:Qingli Zhu, MD
  • 電話番号:+86 13621376699
  • メール:zqlpumch@126.com

研究連絡先のバックアップ

  • 名前:Yinglan Wu, MD
  • 電話番号:+86 15626121076
  • メール:wuylan7@gmail.com

研究場所

      • Beijing、中国、100730
        • 募集
        • Peking Union Medical College Hospital
        • コンタクト:

参加基準

研究者は、適格基準と呼ばれる特定の説明に適合する人を探します。これらの基準のいくつかの例は、人の一般的な健康状態または以前の治療です。

適格基準

就学可能な年齢

  • 大人
  • 高齢者

健康ボランティアの受け入れ

はい

サンプリング方法

非確率サンプル

調査対象母集団

2018年から2025年にかけて北京協和医院で乳房超音波検査を受け、その後病理学的確認が行われた成人患者の非識別化された乳房超音波画像。これに、公開された倫理承認済みのオープンアクセス乳房超音波データセット(例:BUSI、BrEaST)からの画像が補完されています。

説明

対象基準:

  • 施設のPACSデータベースまたは公開されたオープンアクセスの乳房超音波データセットから得られたBモード乳房超音波グレースケール画像で、元の施設の倫理承認が文書化されているもの
  • 臨床診断に十分な画像品質で、関心領域が明確に視覚化されているもの
  • 病理学的診断が確認されている(良性および悪性病変群の場合)、または15年以上の乳房超音波経験を有する上級放射線科医によって正常な乳房状態が確認されているもの(正常群の場合)
  • すべての個人を特定できる情報を除去した完全な匿名化が行われているもの

除外基準:

  • 有意なBI-RADS評価を妨げる重度の画像品質劣化
  • 同一患者からの重複画像(病変ごとに最も代表的な画像のみ保持)
  • 匿名化処理後も個人を特定できる情報が残存している画像
  • 曖昧、論争、または利用不可能な病理結果がある症例
  • Bモード以外の超音波画像(エラストグラフィ、造影超音波、ドップラー画像を含む)

研究計画

このセクションでは、研究がどのように設計され、研究が何を測定しているかなど、研究計画の詳細を提供します。

研究はどのように設計されていますか?

デザインの詳細

コホートと介入

グループ/コホート
介入・治療
正常な乳房
様々な組織構成タイプにわたる正常な乳腺組織を示す乳房超音波画像で、焦点病変は認められません。 上級放射線科医による確認済み。
複数のAIシステム(ResNet-50、USFMなどのベースライン深層学習モデル及びマルチモーダル大規模言語モデルを含む)による匿名化された乳腺超音波画像の後方視的評価を、APIを介した標準化されたBI-RADSガイド連鎖思考プロンプトを用いて実施。 患者との接触や臨床的意思決定は含まれません。
良性病変
病理学的に確認された良性病変(BI-RADS 2-4B)を含む乳房超音波画像。これには線維腺腫、嚢胞、脂肪腫、硬化性腺症、乳管内乳頭腫、および選択された非腫瘤性病変(NML)が含まれます。
複数のAIシステム(ResNet-50、USFMなどのベースライン深層学習モデル及びマルチモーダル大規模言語モデルを含む)による匿名化された乳腺超音波画像の後方視的評価を、APIを介した標準化されたBI-RADSガイド連鎖思考プロンプトを用いて実施。 患者との接触や臨床的意思決定は含まれません。
悪性病変
病理学的に確認された悪性病変(BI-RADS 3-5)を含む乳房超音波画像。これには、浸潤性乳管癌、浸潤性小葉癌、粘液癌、および選択された非腫瘤性病変(NML)が含まれます。
複数のAIシステム(ResNet-50、USFMなどのベースライン深層学習モデル及びマルチモーダル大規模言語モデルを含む)による匿名化された乳腺超音波画像の後方視的評価を、APIを介した標準化されたBI-RADSガイド連鎖思考プロンプトを用いて実施。 患者との接触や臨床的意思決定は含まれません。

この研究は何を測定していますか?

主要な結果の測定

結果測定
メジャーの説明
時間枠
病理診断の診断精度
時間枠:研究完了時、約12ヶ月後
良性・悪性分類におけるAIモデルの感度、特異度、陽性予測値(PPV)、陰性予測値(NPV)、およびF1スコア(組織病理学的診断をゴールドスタンダードとして)
研究完了時、約12ヶ月後
BI-RADS分類精度
時間枠:研究完了時、約12ヶ月
専門家のコンセンサス注釈を基準として、乳房超音波画像にBI-RADSカテゴリー(2、3、4A、4B、4C、5)を割り当てる際のAIモデルの全体的な精度。
研究完了時、約12ヶ月

二次結果の測定

結果測定
メジャーの説明
時間枠
専門家コンセンサスとの一致度(コーエンのカッパ)
時間枠:研究完了時、約12か月後
各AIモデルのBI-RADS分類と専門家のコンセンサスアノテーションとの一致度を測定するCohenのカッパ係数(95%信頼区間付きで報告)。
研究完了時、約12か月後
分布外棄却率
時間枠:研究完了時、約12ヶ月
AIモデルによって正確に識別され拒否された非診断画像(画質低下、非乳房超音波、その他の画像モダリティ)の割合、ドメイン安全性の評価。
研究完了時、約12ヶ月
感度、特異度、PPV、NPV、F1スコア
時間枠:研究完了時、約12ヶ月
良性-悪性分類のための標準診断性能指標は、各AIモデル個別に報告されます。
研究完了時、約12ヶ月

協力者と研究者

ここでは、この調査に関係する人々や組織を見つけることができます。

捜査官

  • 主任研究者:Qingli Zhu, MD、Peking Union Medical College Hospital

出版物と役立つリンク

研究に関する情報を入力する責任者は、自発的にこれらの出版物を提供します。これらは、研究に関連するあらゆるものに関するものである可能性があります。

一般刊行物

研究記録日

これらの日付は、ClinicalTrials.gov への研究記録と要約結果の提出の進捗状況を追跡します。研究記録と報告された結果は、国立医学図書館 (NLM) によって審査され、公開 Web サイトに掲載される前に、特定の品質管理基準を満たしていることが確認されます。

主要日程の研究

研究開始 (実際)

2026年3月12日

一次修了 (推定)

2026年12月1日

研究の完了 (推定)

2027年3月1日

試験登録日

最初に提出

2026年3月24日

QC基準を満たした最初の提出物

2026年3月24日

最初の投稿 (実際)

2026年3月30日

学習記録の更新

投稿された最後の更新 (実際)

2026年3月30日

QC基準を満たした最後の更新が送信されました

2026年3月24日

最終確認日

2026年3月1日

詳しくは

本研究に関する用語

その他の研究ID番号

  • K10349
  • 2024-I2M-CT-B-035 (その他の助成金/資金番号:CAMS Innovation Fund for Medical Sciences)
  • I-26PJ0568 (その他の識別子:Ethics Committee, Peking Union Medical College Hospital)

個々の参加者データ (IPD) の計画

個々の参加者データ (IPD) を共有する予定はありますか?

はい

IPD プランの説明

専門家による注釈付き乳房超音波画像と対応するBI-RADS読影報告を含む非識別化ベンチマーク評価データセットは、学術的な再現性と共同研究を促進するために一般公開を予定しています。

IPD 共有時間枠

主要論文発表後6ヶ月以内、無期限で利用可能

IPD 共有アクセス基準

公認データリポジトリを介したオープンアクセス(詳細は未定)

IPD 共有サポート情報タイプ

  • STUDY_PROTOCOL
  • SAP
  • ANALYTIC_CODE

医薬品およびデバイス情報、研究文書

米国FDA規制医薬品の研究

いいえ

米国FDA規制機器製品の研究

いいえ

この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。

購読する