乳がん超音波AI解釈のベンチマーク構築とマルチモーダルAIモデルの性能評価 (BUST-AI Bench)
ACR BI-RADS v2025基準に基づくマルチモーダル人工知能モデルの体系的パフォーマンス評価と知能型乳房超音波画像解釈の標準化ベンチマーク評価システム構築
この単一施設による後ろ向き観察研究は、インテリジェント乳房超音波画像解析のための標準化されたベンチマーク評価システムを構築し、現在主流のマルチモーダル人工知能(AI)モデルの診断性能を体系的に評価することを目的としています。
病理診断が確定した匿名化されたBモード乳房超音波画像を施設アーカイブ(2018-2025年)から後ろ向きに収集し、公開オープンアクセスデータセットの画像で補完します。 経験レベルが異なる専門放射線科医が、米国放射線学会(ACR)乳房画像報告・データシステム(BI-RADS)v2025基準に従って、腺組織構成、病変特性(腫瘤性病変と非腫瘤性病変)、形態学的記述、最終BI-RADS分類を含め、すべての画像を独立して注釈付けします。
ベースライン深層学習モデル(CNNベースのResNet-50とTransformerベースのUSFM)を訓練し、パフォーマンスベースラインを確立し、クロスアーキテクチャコンセンサスを通じて診断難易度による症例層別化を行います。 次に、汎用モデルと医療領域モデルを含む複数のマルチモーダル大規模言語モデル(MLLM)を、再現性のために温度0でBI-RADS誘導思考連鎖プロンプトを使用した標準化API呼び出しを通じて評価します。
主要評価項目には、BI-RADS分類精度と良性・悪性鑑別の診断AUCが含まれます。 モデルの堅牢性と安全性は、分布外拒否テスト、温度安定性実験、思考モードアブレーション研究を通じて評価されます。 本研究はFLAIRおよびTRIPOD-LLM報告ガイドラインに準拠しています。
調査の概要
詳細な説明
背景:乳がんは世界中の女性において最も罹患率の高い悪性腫瘍です。 超音波検査は第一線のスクリーニング手法であり、特に乳房組織が高濃度でマンモグラフィーの感度が限られるアジア人集団において有用です。 しかし、超音波所見の解釈は検査者への依存性が非常に高く、特にカテゴリー4A-4B病変におけるBI-RADS分類では観察者間の変動が顕著です。 マルチモーダル大規模言語モデル(MLLMs)は、ゼロショット診断能力、解釈可能な思考連鎖推論、構造化レポート生成により、医療画像解析の有望なツールとして登場しました。 それにもかかわらず、現時点では乳がん超音波所見解釈におけるAI性能を評価する標準化されたベンチマークは存在しません。
研究デザイン:約1,380枚の乳がん超音波画像を選定します(評価セット1,200枚+分布外安全性テストセット150枚+プロンプト開発セット30枚)。これらは3つの診断カテゴリーを含みます:正常乳房、良性病変(BI-RADS 2-4B)、悪性病変(BI-RADS 3-5)。 経験年数5年未満の若手放射線科医2名と経験年数15年以上の上級放射線科医2名が、ACR BI-RADS v2025に基づき画像を独立して注釈付けし、不一致症例については第5の専門家による調停を行います。
診断難易度は、クロスアーキテクチャ深層学習コンセンサスを用いて3段階に層別化されます:Tier 1(明瞭、両モデル正解)、Tier 2(疑わしい、片方正解/片方不正解)、Tier 3(困難、両モデル不正解、上級専門家による検証あり)。 MLLMsは複数の次元で評価されます:分類精度、感度、特異度、F1スコア、AUC、専門家コンセンサスとのコーエンのカッパ一致度、期待校正誤差(ECE)、形態的特徴記述精度、思考連鎖推論の質。
安全性評価:(1)150枚の非診断画像(画質劣化画像、非乳房超音波、他の画像モダリティ)を用いた分布外拒否テスト;(2)パラメータ設定にわたる温度安定性事前実験;(3)標準推論モードと思考連鎖推論モードを比較する思考モードアブレーション。 すべての実験は固定モデルスナップショット、システムフィンガープリント監視、再現性のための完全なログ記録を使用します。
研究の種類
入学 (推定)
連絡先と場所
研究連絡先
- 名前:Qingli Zhu, MD
- 電話番号:+86 13621376699
- メール:zqlpumch@126.com
研究連絡先のバックアップ
- 名前:Yinglan Wu, MD
- 電話番号:+86 15626121076
- メール:wuylan7@gmail.com
研究場所
-
-
-
Beijing、中国、100730
- 募集
- Peking Union Medical College Hospital
-
コンタクト:
- Qingli Zhu, MD
- 電話番号:+86 13621376699
- メール:zqlpumch@126.com
-
-
参加基準
適格基準
就学可能な年齢
- 大人
- 高齢者
健康ボランティアの受け入れ
サンプリング方法
調査対象母集団
説明
対象基準:
- 施設のPACSデータベースまたは公開されたオープンアクセスの乳房超音波データセットから得られたBモード乳房超音波グレースケール画像で、元の施設の倫理承認が文書化されているもの
- 臨床診断に十分な画像品質で、関心領域が明確に視覚化されているもの
- 病理学的診断が確認されている(良性および悪性病変群の場合)、または15年以上の乳房超音波経験を有する上級放射線科医によって正常な乳房状態が確認されているもの(正常群の場合)
- すべての個人を特定できる情報を除去した完全な匿名化が行われているもの
除外基準:
- 有意なBI-RADS評価を妨げる重度の画像品質劣化
- 同一患者からの重複画像(病変ごとに最も代表的な画像のみ保持)
- 匿名化処理後も個人を特定できる情報が残存している画像
- 曖昧、論争、または利用不可能な病理結果がある症例
- Bモード以外の超音波画像(エラストグラフィ、造影超音波、ドップラー画像を含む)
研究計画
研究はどのように設計されていますか?
デザインの詳細
コホートと介入
グループ/コホート |
介入・治療 |
|---|---|
|
正常な乳房
様々な組織構成タイプにわたる正常な乳腺組織を示す乳房超音波画像で、焦点病変は認められません。
上級放射線科医による確認済み。
|
複数のAIシステム(ResNet-50、USFMなどのベースライン深層学習モデル及びマルチモーダル大規模言語モデルを含む)による匿名化された乳腺超音波画像の後方視的評価を、APIを介した標準化されたBI-RADSガイド連鎖思考プロンプトを用いて実施。
患者との接触や臨床的意思決定は含まれません。
|
|
良性病変
病理学的に確認された良性病変(BI-RADS 2-4B)を含む乳房超音波画像。これには線維腺腫、嚢胞、脂肪腫、硬化性腺症、乳管内乳頭腫、および選択された非腫瘤性病変(NML)が含まれます。
|
複数のAIシステム(ResNet-50、USFMなどのベースライン深層学習モデル及びマルチモーダル大規模言語モデルを含む)による匿名化された乳腺超音波画像の後方視的評価を、APIを介した標準化されたBI-RADSガイド連鎖思考プロンプトを用いて実施。
患者との接触や臨床的意思決定は含まれません。
|
|
悪性病変
病理学的に確認された悪性病変(BI-RADS 3-5)を含む乳房超音波画像。これには、浸潤性乳管癌、浸潤性小葉癌、粘液癌、および選択された非腫瘤性病変(NML)が含まれます。
|
複数のAIシステム(ResNet-50、USFMなどのベースライン深層学習モデル及びマルチモーダル大規模言語モデルを含む)による匿名化された乳腺超音波画像の後方視的評価を、APIを介した標準化されたBI-RADSガイド連鎖思考プロンプトを用いて実施。
患者との接触や臨床的意思決定は含まれません。
|
この研究は何を測定していますか?
主要な結果の測定
結果測定 |
メジャーの説明 |
時間枠 |
|---|---|---|
|
病理診断の診断精度
時間枠:研究完了時、約12ヶ月後
|
良性・悪性分類におけるAIモデルの感度、特異度、陽性予測値(PPV)、陰性予測値(NPV)、およびF1スコア(組織病理学的診断をゴールドスタンダードとして)
|
研究完了時、約12ヶ月後
|
|
BI-RADS分類精度
時間枠:研究完了時、約12ヶ月
|
専門家のコンセンサス注釈を基準として、乳房超音波画像にBI-RADSカテゴリー(2、3、4A、4B、4C、5)を割り当てる際のAIモデルの全体的な精度。
|
研究完了時、約12ヶ月
|
二次結果の測定
結果測定 |
メジャーの説明 |
時間枠 |
|---|---|---|
|
専門家コンセンサスとの一致度(コーエンのカッパ)
時間枠:研究完了時、約12か月後
|
各AIモデルのBI-RADS分類と専門家のコンセンサスアノテーションとの一致度を測定するCohenのカッパ係数(95%信頼区間付きで報告)。
|
研究完了時、約12か月後
|
|
分布外棄却率
時間枠:研究完了時、約12ヶ月
|
AIモデルによって正確に識別され拒否された非診断画像(画質低下、非乳房超音波、その他の画像モダリティ)の割合、ドメイン安全性の評価。
|
研究完了時、約12ヶ月
|
|
感度、特異度、PPV、NPV、F1スコア
時間枠:研究完了時、約12ヶ月
|
良性-悪性分類のための標準診断性能指標は、各AIモデル個別に報告されます。
|
研究完了時、約12ヶ月
|
協力者と研究者
捜査官
- 主任研究者:Qingli Zhu, MD、Peking Union Medical College Hospital
出版物と役立つリンク
一般刊行物
- Sung H, Ferlay J, Siegel RL, Laversanne M, Soerjomataram I, Jemal A, Bray F. Global Cancer Statistics 2020: GLOBOCAN Estimates of Incidence and Mortality Worldwide for 36 Cancers in 185 Countries. CA Cancer J Clin. 2021 May;71(3):209-249. doi: 10.3322/caac.21660. Epub 2021 Feb 4.
- Bi WL, Hosny A, Schabath MB, Giger ML, Birkbak NJ, Mehrtash A, Allison T, Arnaout O, Abbosh C, Dunn IF, Mak RH, Tamimi RM, Tempany CM, Swanton C, Hoffmann U, Schwartz LH, Gillies RJ, Huang RY, Aerts HJWL. Artificial intelligence in cancer imaging: Clinical challenges and applications. CA Cancer J Clin. 2019 Mar;69(2):127-157. doi: 10.3322/caac.21552. Epub 2019 Feb 5.
- Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, Ghassemi M, Liu X, Reitsma JB, van Smeden M, Boulesteix AL, Camaradou JC, Celi LA, Denaxas S, Denniston AK, Glocker B, Golub RM, Harvey H, Heinze G, Hoffman MM, Kengne AP, Lam E, Lee N, Loder EW, Maier-Hein L, Mateen BA, McCradden MD, Oakden-Rayner L, Ordish J, Parnell R, Rose S, Singh K, Wynants L, Logullo P. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024 Apr 16;385:e078378. doi: 10.1136/bmj-2023-078378.
- Benary M, Wang XD, Schmidt M, Soll D, Hilfenhaus G, Nassir M, Sigler C, Knodler M, Keller U, Beule D, Keilholz U, Leser U, Rieke DT. Leveraging Large Language Models for Decision Support in Personalized Oncology. JAMA Netw Open. 2023 Nov 1;6(11):e2343689. doi: 10.1001/jamanetworkopen.2023.43689.
- Bhayana R, Krishna S, Bleakney RR. Performance of ChatGPT on a Radiology Board-style Examination: Insights into Current Strengths and Limitations. Radiology. 2023 Jun;307(5):e230582. doi: 10.1148/radiol.230582. Epub 2023 May 16.
- Clusmann J, Kolbinger FR, Muti HS, Carrero ZI, Eckardt JN, Laleh NG, Loffler CML, Schwarzkopf SC, Unger M, Veldhuizen GP, Wagner SJ, Kather JN. The future landscape of large language models in medicine. Commun Med (Lond). 2023 Oct 10;3(1):141. doi: 10.1038/s43856-023-00370-1.
- Seyyed-Kalantari L, Zhang H, McDermott MBA, Chen IY, Ghassemi M. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021 Dec;27(12):2176-2182. doi: 10.1038/s41591-021-01595-0. Epub 2021 Dec 10.
- Moor M, Banerjee O, Abad ZSH, Krumholz HM, Leskovec J, Topol EJ, Rajpurkar P. Foundation models for generalist medical artificial intelligence. Nature. 2023 Apr;616(7956):259-265. doi: 10.1038/s41586-023-05881-4. Epub 2023 Apr 12.
- Miaojiao S, Xia L, Xian Tao Z, Zhi Liang H, Sheng C, Songsong W. Using a Large Language Model for Breast Imaging Reporting and Data System Classification and Malignancy Prediction to Enhance Breast Ultrasound Diagnosis: Retrospective Study. JMIR Med Inform. 2025 Jun 11;13:e70924. doi: 10.2196/70924.
- Jiao J, Zhou J, Li X, Xia M, Huang Y, Huang L, Wang N, Zhang X, Zhou S, Wang Y, Guo Y. USFM: A universal ultrasound foundation model generalized to tasks and organs towards label efficient image analysis. Med Image Anal. 2024 Aug;96:103202. doi: 10.1016/j.media.2024.103202. Epub 2024 May 15.
- Xiang H, Wang X, Xu M, Zhang Y, Zeng S, Li C, Liu L, Deng T, Tang G, Yan C, Ou J, Lin Q, He J, Sun P, Li A, Chen H, Heng PA, Lin X. Deep Learning-assisted Diagnosis of Breast Lesions on US Images: A Multivendor, Multicenter Study. Radiol Artif Intell. 2023 Jul 12;5(5):e220185. doi: 10.1148/ryai.220185. eCollection 2023 Sep.
- Kottlors J, Iuga AI, Bluethgen C, Bressem K, Kather JN, Moy L, Wald C, Wang W, Liu T, Ranschaert E, Dratsch T, Kleesiek J, Gertz RJ, Rajpurkar P, Bedayat A, Fink MA, Zeeck A, Chaudhari A, Alkasab T, Wu H, Nensa F, Wang B, Grosse Hokamp N, Laukamp KR, Persigehl T, Maintz D, Truhn D, Lennartz S. Guidelines for Reporting Studies on Large Language Models in Radiology: An International Delphi Expert Survey. Radiology. 2026 Feb;318(2):e250913. doi: 10.1148/radiol.250913.
研究記録日
主要日程の研究
研究開始 (実際)
一次修了 (推定)
研究の完了 (推定)
試験登録日
最初に提出
QC基準を満たした最初の提出物
最初の投稿 (実際)
学習記録の更新
投稿された最後の更新 (実際)
QC基準を満たした最後の更新が送信されました
最終確認日
詳しくは
本研究に関する用語
その他の研究ID番号
- K10349
- 2024-I2M-CT-B-035 (その他の助成金/資金番号:CAMS Innovation Fund for Medical Sciences)
- I-26PJ0568 (その他の識別子:Ethics Committee, Peking Union Medical College Hospital)
個々の参加者データ (IPD) の計画
個々の参加者データ (IPD) を共有する予定はありますか?
IPD プランの説明
IPD 共有時間枠
IPD 共有アクセス基準
IPD 共有サポート情報タイプ
- STUDY_PROTOCOL
- SAP
- ANALYTIC_CODE
医薬品およびデバイス情報、研究文書
米国FDA規制医薬品の研究
米国FDA規制機器製品の研究
この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。