构建乳腺超声人工智能解读基准与多模态人工智能模型性能评估 (BUST-AI Bench)
基于ACR BI-RADS v2025标准构建智能乳腺超声图像解读标准化基准评估体系及多模态人工智能模型的系统性性能评估
这项单中心、回顾性、观察性研究旨在构建智能乳腺超声图像解读的标准化基准评估体系,并系统评估当前主流多模态人工智能(AI)模型的诊断性能。
研究将从机构档案库(2018-2025年)回顾性收集经病理诊断确认的去标识化B型乳腺超声图像,并补充来自已发表开放获取数据集的图像。 不同经验水平的放射科专家将根据美国放射学会(ACR)乳腺影像报告和数据系统(BI-RADS)v2025标准独立标注所有图像,包括腺体组织构成、病灶特征(肿块与非肿块病变)、形态学描述符及最终BI-RADS分类。
研究将训练基线深度学习模型(基于CNN的ResNet-50和基于Transformer的USFM)以建立性能基准,并通过跨架构共识对病例按诊断难度进行分层。 随后将通过标准化API调用,使用温度参数设为0的BI-RADS引导思维链提示(确保可复现性),对包括通用模型和医学领域模型在内的多个多模态大语言模型(MLLM)进行评估。
主要终点包括BI-RADS分类准确率和良恶性鉴别的诊断AUC。 将通过分布外拒识测试、温度稳定性实验和思维模式消融研究评估模型的鲁棒性与安全性。 本研究遵循FLAIR和TRIPOD-LLM报告规范。
研究概览
详细说明
背景:乳腺癌是全球女性中最常见的恶性肿瘤。超声检查是一线筛查手段,特别是在亚洲人群中,由于乳腺组织致密,乳腺X线摄影的敏感性受限。然而,超声解读高度依赖于操作者,在BI-RADS分类中存在显著的观察者间差异,特别是对于4A-4B类病变。多模态大语言模型(MLLMs)因其零样本诊断能力、可解释的思维链推理和结构化报告生成,已成为医学图像分析的有前景工具。尽管如此,目前尚无评估AI在乳腺超声解读中性能的标准化基准。
研究设计:将整理约1,380张乳腺超声图像(1,200张评估集 + 150张分布外安全测试集 + 30张提示开发集),涵盖三个诊断类别:正常乳腺、良性病变(BI-RADS 2-4B)和恶性病变(BI-RADS 3-5)。两名初级放射科医生(<5年经验)和两名高级放射科医生(>15年经验)将根据ACR BI-RADS v2025独立标注图像,并由第五位专家对不一致案例进行仲裁。
诊断难度将使用跨架构深度学习共识分为三个层级:层级1(直接,两个模型均正确)、层级2(模棱两可,一个正确/一个错误)和层级3(困难,两个均错误,需高级专家验证)。MLLMs将在多个维度进行评估:分类准确性、敏感性、特异性、F1分数、AUC、与专家共识的Cohen's kappa一致性、期望校准误差(ECE)、形态特征描述准确性和思维链推理质量。
安全评估:(1) 使用150张非诊断图像(降质图像、非乳腺超声、其他成像模态)进行分布外拒绝测试;(2) 跨参数设置的温度稳定性预实验;(3) 思维模式消融比较标准与思维链推理模式。所有实验使用固定模型快照、系统指纹监控和完整日志记录以确保可重复性。
研究类型
注册 (估计的)
联系人和位置
学习联系方式
- 姓名:Qingli Zhu, MD
- 电话号码:+86 13621376699
- 邮箱:zqlpumch@126.com
研究联系人备份
- 姓名:Yinglan Wu, MD
- 电话号码:+86 15626121076
- 邮箱:wuylan7@gmail.com
学习地点
-
-
-
Beijing、中国、100730
- 招聘中
- Peking Union Medical College Hospital
-
接触:
- Qingli Zhu, MD
- 电话号码:+86 13621376699
- 邮箱:zqlpumch@126.com
-
-
参与标准
资格标准
适合学习的年龄
- 成人
- 年长者
接受健康志愿者
取样方法
研究人群
描述
纳入标准:
- 来自机构PACS数据库或已发表开放获取乳腺超声数据集的B模式乳腺超声灰度图像,需具备原始机构伦理批准文件
- 图像质量符合临床诊断要求,感兴趣区域清晰可见
- 病理诊断已确认(针对良性和恶性病变组),或由具有15年以上乳腺超声经验的高级放射科医师确认乳腺正常状态(针对正常组)
- 已完成完全去标识化处理,移除所有个人身份信息
排除标准:
- 图像质量严重退化,无法进行有意义的BI-RADS评估
- 来自同一患者的重复图像(每个病变仅保留最具代表性的图像)
- 去标识化处理后仍残留个人身份信息的图像
- 病理结果不明确、存在争议或无法获取的病例
- 非B模式超声图像,包括弹性成像、超声造影和多普勒成像
学习计划
研究是如何设计的?
设计细节
队列和干预
团体/队列 |
干预/治疗 |
|---|---|
|
正常乳房
乳腺超声图像显示不同组织构成类型的正常腺体组织,未发现局灶性病变。
经高级放射科医师审核确认。
|
通过API使用标准化的BI-RADS引导思维链提示,由多个AI系统(包括基线深度学习模型ResNet-50、USFM和多模态大语言模型)对去标识化乳腺超声图像进行回顾性评估。
不涉及患者接触或临床决策。
|
|
良性病变
包含经病理证实的良性病变(BI-RADS 2-4B)的乳腺超声图像,包括纤维腺瘤、囊肿、脂肪瘤、硬化性腺病、导管内乳头状瘤以及选定的非肿块性病变(NML)。
|
通过API使用标准化的BI-RADS引导思维链提示,由多个AI系统(包括基线深度学习模型ResNet-50、USFM和多模态大语言模型)对去标识化乳腺超声图像进行回顾性评估。
不涉及患者接触或临床决策。
|
|
恶性病变
包含经病理学确诊的恶性病变(BI-RADS 3-5级)的乳腺超声图像,包括浸润性导管癌、浸润性小叶癌、黏液癌以及选定的非肿块性病变(NML)。
|
通过API使用标准化的BI-RADS引导思维链提示,由多个AI系统(包括基线深度学习模型ResNet-50、USFM和多模态大语言模型)对去标识化乳腺超声图像进行回顾性评估。
不涉及患者接触或临床决策。
|
研究衡量的是什么?
主要结果指标
结果测量 |
措施说明 |
大体时间 |
|---|---|---|
|
病理学诊断的诊断准确性
大体时间:研究结束时,大约12个月
|
以组织病理学诊断为金标准,AI模型用于良恶性分类的灵敏度、特异度、阳性预测值(PPV)、阴性预测值(NPV)和F1分数。
|
研究结束时,大约12个月
|
|
BI-RADS 分类准确性
大体时间:研究完成时,大约12个月
|
AI模型在将乳腺超声图像分配至BI-RADS类别(2、3、4A、4B、4C、5)时的总体准确度,以专家共识标注作为参考标准进行比较。
|
研究完成时,大约12个月
|
次要结果测量
结果测量 |
措施说明 |
大体时间 |
|---|---|---|
|
与专家共识的一致性(Cohen's Kappa)
大体时间:研究完成时,约12个月
|
Cohen's kappa系数,用于衡量每个AI模型的BI-RADS分类与专家共识标注之间的一致性,报告时附带95%置信区间。
|
研究完成时,约12个月
|
|
分布外拒绝率
大体时间:研究完成时,约12个月
|
AI模型正确识别并拒绝的非诊断性图像(质量下降、非乳腺超声、其他成像模式)的比例,用于评估领域安全性。
|
研究完成时,约12个月
|
|
敏感性、特异性、阳性预测值、阴性预测值和F1分数
大体时间:研究完成时,大约12个月
|
针对每个AI模型单独报告的良恶性分类标准诊断性能指标。
|
研究完成时,大约12个月
|
合作者和调查者
调查人员
- 首席研究员:Qingli Zhu, MD、Peking Union Medical College Hospital
出版物和有用的链接
一般刊物
- Sung H, Ferlay J, Siegel RL, Laversanne M, Soerjomataram I, Jemal A, Bray F. Global Cancer Statistics 2020: GLOBOCAN Estimates of Incidence and Mortality Worldwide for 36 Cancers in 185 Countries. CA Cancer J Clin. 2021 May;71(3):209-249. doi: 10.3322/caac.21660. Epub 2021 Feb 4.
- Bi WL, Hosny A, Schabath MB, Giger ML, Birkbak NJ, Mehrtash A, Allison T, Arnaout O, Abbosh C, Dunn IF, Mak RH, Tamimi RM, Tempany CM, Swanton C, Hoffmann U, Schwartz LH, Gillies RJ, Huang RY, Aerts HJWL. Artificial intelligence in cancer imaging: Clinical challenges and applications. CA Cancer J Clin. 2019 Mar;69(2):127-157. doi: 10.3322/caac.21552. Epub 2019 Feb 5.
- Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, Ghassemi M, Liu X, Reitsma JB, van Smeden M, Boulesteix AL, Camaradou JC, Celi LA, Denaxas S, Denniston AK, Glocker B, Golub RM, Harvey H, Heinze G, Hoffman MM, Kengne AP, Lam E, Lee N, Loder EW, Maier-Hein L, Mateen BA, McCradden MD, Oakden-Rayner L, Ordish J, Parnell R, Rose S, Singh K, Wynants L, Logullo P. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024 Apr 16;385:e078378. doi: 10.1136/bmj-2023-078378.
- Benary M, Wang XD, Schmidt M, Soll D, Hilfenhaus G, Nassir M, Sigler C, Knodler M, Keller U, Beule D, Keilholz U, Leser U, Rieke DT. Leveraging Large Language Models for Decision Support in Personalized Oncology. JAMA Netw Open. 2023 Nov 1;6(11):e2343689. doi: 10.1001/jamanetworkopen.2023.43689.
- Bhayana R, Krishna S, Bleakney RR. Performance of ChatGPT on a Radiology Board-style Examination: Insights into Current Strengths and Limitations. Radiology. 2023 Jun;307(5):e230582. doi: 10.1148/radiol.230582. Epub 2023 May 16.
- Clusmann J, Kolbinger FR, Muti HS, Carrero ZI, Eckardt JN, Laleh NG, Loffler CML, Schwarzkopf SC, Unger M, Veldhuizen GP, Wagner SJ, Kather JN. The future landscape of large language models in medicine. Commun Med (Lond). 2023 Oct 10;3(1):141. doi: 10.1038/s43856-023-00370-1.
- Seyyed-Kalantari L, Zhang H, McDermott MBA, Chen IY, Ghassemi M. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021 Dec;27(12):2176-2182. doi: 10.1038/s41591-021-01595-0. Epub 2021 Dec 10.
- Moor M, Banerjee O, Abad ZSH, Krumholz HM, Leskovec J, Topol EJ, Rajpurkar P. Foundation models for generalist medical artificial intelligence. Nature. 2023 Apr;616(7956):259-265. doi: 10.1038/s41586-023-05881-4. Epub 2023 Apr 12.
- Miaojiao S, Xia L, Xian Tao Z, Zhi Liang H, Sheng C, Songsong W. Using a Large Language Model for Breast Imaging Reporting and Data System Classification and Malignancy Prediction to Enhance Breast Ultrasound Diagnosis: Retrospective Study. JMIR Med Inform. 2025 Jun 11;13:e70924. doi: 10.2196/70924.
- Jiao J, Zhou J, Li X, Xia M, Huang Y, Huang L, Wang N, Zhang X, Zhou S, Wang Y, Guo Y. USFM: A universal ultrasound foundation model generalized to tasks and organs towards label efficient image analysis. Med Image Anal. 2024 Aug;96:103202. doi: 10.1016/j.media.2024.103202. Epub 2024 May 15.
- Xiang H, Wang X, Xu M, Zhang Y, Zeng S, Li C, Liu L, Deng T, Tang G, Yan C, Ou J, Lin Q, He J, Sun P, Li A, Chen H, Heng PA, Lin X. Deep Learning-assisted Diagnosis of Breast Lesions on US Images: A Multivendor, Multicenter Study. Radiol Artif Intell. 2023 Jul 12;5(5):e220185. doi: 10.1148/ryai.220185. eCollection 2023 Sep.
- Kottlors J, Iuga AI, Bluethgen C, Bressem K, Kather JN, Moy L, Wald C, Wang W, Liu T, Ranschaert E, Dratsch T, Kleesiek J, Gertz RJ, Rajpurkar P, Bedayat A, Fink MA, Zeeck A, Chaudhari A, Alkasab T, Wu H, Nensa F, Wang B, Grosse Hokamp N, Laukamp KR, Persigehl T, Maintz D, Truhn D, Lennartz S. Guidelines for Reporting Studies on Large Language Models in Radiology: An International Delphi Expert Survey. Radiology. 2026 Feb;318(2):e250913. doi: 10.1148/radiol.250913.
研究记录日期
研究主要日期
学习开始 (实际的)
初级完成 (估计的)
研究完成 (估计的)
研究注册日期
首次提交
首先提交符合 QC 标准的
首次发布 (实际的)
研究记录更新
最后更新发布 (实际的)
上次提交的符合 QC 标准的更新
最后验证
更多信息
与本研究相关的术语
其他研究编号
- K10349
- 2024-I2M-CT-B-035 (其他赠款/资助编号:CAMS Innovation Fund for Medical Sciences)
- I-26PJ0568 (其他标识符:Ethics Committee, Peking Union Medical College Hospital)
计划个人参与者数据 (IPD)
计划共享个人参与者数据 (IPD)?
IPD 计划说明
IPD 共享时间框架
IPD 共享访问标准
IPD 共享支持信息类型
- 研究方案
- 树液
- 分析代码
药物和器械信息、研究文件
研究美国 FDA 监管的药品
研究美国 FDA 监管的设备产品
此信息直接从 clinicaltrials.gov 网站检索,没有任何更改。如果您有任何更改、删除或更新研究详细信息的请求,请联系 register@clinicaltrials.gov. clinicaltrials.gov 上实施更改,我们的网站上也会自动更新.