- ICH GCP
- Реестр клинических исследований США
- Клиническое испытание NCT07500428
Создание эталона для интерпретации ультразвукового исследования молочных желез с использованием искусственного интеллекта и оценка производительности мультимодальных моделей ИИ (BUST-AI Bench)
Разработка стандартизированной системы эталонной оценки для интеллектуальной интерпретации ультразвуковых изображений молочной железы и систематической оценки производительности мультимодальных моделей искусственного интеллекта на основе критериев ACR BI-RADS v2025
Это одноцентровое ретроспективное наблюдательное исследование направлено на создание стандартизированной системы оценки для интеллектуальной интерпретации ультразвуковых изображений молочных желез и систематическую оценку диагностической эффективности современных многофункциональных моделей искусственного интеллекта (ИИ).
Обезличенные В-режимные ультразвуковые изображения молочных желез с подтвержденными патологическими диагнозами будут ретроспективно собраны из институционального архива (2018-2025 гг.) и дополнены изображениями из опубликованных открытых наборов данных. Экспертные радиологи с различным уровнем опыта независимо аннотируют все изображения в соответствии с критериями системы отчетности и данных по визуализации молочных желез Американского колледжа радиологии (ACR BI-RADS) версии 2025, включая состав железистой ткани, характеристику поражения (объемное vs. необъемное поражение), морфологические дескрипторы и окончательную классификацию по BI-RADS.
Базовые модели глубокого обучения (основанные на CNN ResNet-50 и основанные на трансформерах USFM) будут обучены для установления базовых показателей производительности и стратификации случаев по диагностической сложности посредством межархитектурного консенсуса. Затем несколько многофункциональных больших языковых моделей (MLLM), включая как универсальные, так и медицинские модели, будут оценены через стандартизированные API-вызовы с использованием управляемых BI-RADS цепочек рассуждений при температуре 0 для воспроизводимости.
Первичные конечные точки включают точность классификации по BI-RADS и диагностическую AUC для дифференциации доброкачественных и злокачественных образований. Робастность и безопасность моделей будут оценены через тестирование отклонения вне распределения, эксперименты по температурной стабильности и исследования абляции режимов мышления. Данное исследование соответствует руководствам по отчетности FLAIR и TRIPOD-LLM.
Обзор исследования
Статус
Подробное описание
Предпосылки: Рак молочной железы является наиболее распространенным злокачественным новообразованием среди женщин во всем мире. Ультразвуковое исследование является методом скрининга первой линии, особенно в азиатских популяциях с плотной тканью молочной железы, где чувствительность маммографии ограничена. Однако интерпретация ультразвуковых данных в значительной степени зависит от оператора, с существенной межнаблюдательной вариабельностью в классификации BI-RADS, особенно для поражений категории 4A-4B. Мультимодальные большие языковые модели (MLLM) стали перспективным инструментом для анализа медицинских изображений благодаря их способности к диагностике «с нуля», интерпретируемой цепочке логических рассуждений и генерации структурированных отчетов. Тем не менее, в настоящее время отсутствует стандартизированный эталон для оценки производительности ИИ в интерпретации ультразвуковых исследований молочной железы.
Дизайн исследования: Будет отобрано приблизительно 1380 ультразвуковых изображений молочной железы (1200 для оценочного набора + 150 для тестового набора безопасности вне распределения + 30 для набора разработки промптов), охватывающих три диагностические категории: нормальная молочная железа, доброкачественные поражения (BI-RADS 2-4B) и злокачественные поражения (BI-RADS 3-5). Два младших радиолога (стаж <5 лет) и два старших радиолога (стаж >15 лет) независимо аннотируют изображения в соответствии с ACR BI-RADS v2025, с арбитражем пятого эксперта в случае расхождений.
Диагностическая сложность будет стратифицирована на три уровня с использованием консенсуса глубокого обучения на кросс-архитектурной основе: Уровень 1 (прямолинейный, обе модели правильны), Уровень 2 (неоднозначный, одна правильна/одна ошибочна) и Уровень 3 (сложный, обе ошибочны, с валидацией старшего эксперта). MLLM будут оцениваться по нескольким параметрам: точность классификации, чувствительность, специфичность, F1-оценка, AUC, согласие по коэффициенту каппа Коэна с экспертным консенсусом, ожидаемая ошибка калибровки (ECE), точность описания морфологических признаков и качество цепочки логических рассуждений.
Оценка безопасности: (1) Тест на отклонение вне распределения с использованием 150 недиагностических изображений (деградированные изображения, не ультразвук молочной железы, другие методы визуализации); (2) Предварительный эксперимент на температурную стабильность по различным настройкам параметров; (3) Абляция режима мышления, сравнивающая стандартный режим и режим цепочки логических рассуждений. Все эксперименты используют фиксированные снимки моделей, мониторинг системных отпечатков и полное протоколирование для обеспечения воспроизводимости.
Тип исследования
Регистрация (Оцененный)
Контакты и местонахождение
Контакты исследования
- Имя: Qingli Zhu, MD
- Номер телефона: +86 13621376699
- Электронная почта: zqlpumch@126.com
Учебное резервное копирование контактов
- Имя: Yinglan Wu, MD
- Номер телефона: +86 15626121076
- Электронная почта: wuylan7@gmail.com
Места учебы
-
-
-
Beijing, Китай, 100730
- Рекрутинг
- Peking Union Medical College Hospital
-
Контакт:
- Qingli Zhu, MD
- Номер телефона: +86 13621376699
- Электронная почта: zqlpumch@126.com
-
-
Критерии участия
Критерии приемлемости
Возраст, подходящий для обучения
- Взрослый
- Пожилой взрослый
Принимает здоровых добровольцев
Метод выборки
Исследуемая популяция
Описание
Критерии включения:
- В-режимные черно-белые ультразвуковые изображения молочных желез из институциональной базы данных PACS или из опубликованных общедоступных наборов данных ультразвукового исследования молочных желез с документально подтвержденным первоначальным институциональным этическим одобрением
- Качество изображения, достаточное для клинической диагностики с четкой визуализацией области интереса
- Подтвержденный патологический диагноз (для групп доброкачественных и злокачественных поражений) или нормальное состояние молочной железы, подтвержденное старшим радиологом с опытом работы в ультразвуковом исследовании молочных желез более 15 лет (для группы нормы)
- Полная де-идентификация с удалением всей личной идентифицируемой информации
Критерии исключения:
- Сильно ухудшенное качество изображения, препятствующее значимой оценке BI-RADS
- Дубликаты изображений от одного пациента (только наиболее репрезентативное изображение сохраняется на одно поражение)
- Изображения с остаточной личной идентифицируемой информацией после обработки де-идентификации
- Случаи с неоднозначными, спорными или недоступными патологическими результатами
- Не В-режимные ультразвуковые изображения, включая эластографию, контрастно-усиленное ультразвуковое исследование и допплеровское изображение
Учебный план
Как устроено исследование?
Детали дизайна
Когорты и вмешательства
Группа / когорта |
Вмешательство/лечение |
|---|---|
|
Нормальная молочная железа
Ультразвуковые изображения молочной железы, показывающие нормальную железистую ткань при различных типах состава ткани, без выявления очаговых поражений.
Подтверждено проверкой старшего рентгенолога.
|
Ретроспективная оценка обезличенных изображений ультразвукового исследования молочной железы несколькими системами искусственного интеллекта, включая базовые модели глубокого обучения (ResNet-50, USFM) и мультимодальные большие языковые модели, с использованием стандартизированных подсказок по цепочке рассуждений на основе BI-RADS через API.
Контакт с пациентами или принятие клинических решений не предусмотрены.
|
|
Доброкачественное образование
Ультразвуковые изображения молочной железы, содержащие патологически подтвержденные доброкачественные поражения (BI-RADS 2-4B), включая фиброаденому, кисту, липому, склерозирующий аденоз, внутрипротоковую папиллому и выбранные не-объемные поражения (NML).
|
Ретроспективная оценка обезличенных изображений ультразвукового исследования молочной железы несколькими системами искусственного интеллекта, включая базовые модели глубокого обучения (ResNet-50, USFM) и мультимодальные большие языковые модели, с использованием стандартизированных подсказок по цепочке рассуждений на основе BI-RADS через API.
Контакт с пациентами или принятие клинических решений не предусмотрены.
|
|
Злокачественное поражение
Ультразвуковые изображения молочной железы, содержащие патологически подтвержденные злокачественные поражения (BI-RADS 3-5), включая инвазивный протоковый рак, инвазивный дольковый рак, муцинозный рак и выбранные необъемные поражения (NML).
|
Ретроспективная оценка обезличенных изображений ультразвукового исследования молочной железы несколькими системами искусственного интеллекта, включая базовые модели глубокого обучения (ResNet-50, USFM) и мультимодальные большие языковые модели, с использованием стандартизированных подсказок по цепочке рассуждений на основе BI-RADS через API.
Контакт с пациентами или принятие клинических решений не предусмотрены.
|
Что измеряет исследование?
Первичные показатели результатов
Мера результата |
Мера Описание |
Временное ограничение |
|---|---|---|
|
Диагностическая точность для патологического диагноза
Временное ограничение: По завершении исследования, приблизительно через 12 месяцев
|
Чувствительность, специфичность, положительная прогностическая ценность (ППЦ), отрицательная прогностическая ценность (ОПЦ) и F1-мера моделей ИИ для классификации доброкачественных-злокачественных образований, с гистопатологическим диагнозом в качестве золотого стандарта.
|
По завершении исследования, приблизительно через 12 месяцев
|
|
Точность классификации BI-RADS
Временное ограничение: По завершении исследования, приблизительно через 12 месяцев
|
Общая точность моделей ИИ в присвоении категорий BI-RADS (2, 3, 4A, 4B, 4C, 5) ультразвуковым изображениям молочных желёз по сравнению с экспертным консенсусным аннотированием в качестве эталонного стандарта.
|
По завершении исследования, приблизительно через 12 месяцев
|
Вторичные показатели результатов
Мера результата |
Мера Описание |
Временное ограничение |
|---|---|---|
|
Согласие с экспертным консенсусом (каппа Коэна)
Временное ограничение: По завершении исследования, приблизительно через 12 месяцев
|
Коэффициент каппа Коэна, измеряющий согласие между классификацией BI-RADS каждой модели искусственного интеллекта и экспертной консенсусной аннотацией, представленный с 95% доверительными интервалами.
|
По завершении исследования, приблизительно через 12 месяцев
|
|
Частота отбраковки вне распределения
Временное ограничение: По завершении исследования, примерно через 12 месяцев
|
Доля недиагностических изображений (низкого качества, не относящихся к ультразвуковому исследованию молочных желез, других методов визуализации), правильно идентифицированных и отклоненных моделями ИИ, для оценки безопасности области применения.
|
По завершении исследования, примерно через 12 месяцев
|
|
Чувствительность, Специфичность, ППВ, ОПВ и F1-оценка
Временное ограничение: По завершении исследования, примерно через 12 месяцев
|
Стандартные метрики диагностической эффективности для классификации доброкачественных-злокачественных образований, представленные для каждой модели ИИ отдельно.
|
По завершении исследования, примерно через 12 месяцев
|
Соавторы и исследователи
Соавторы
Следователи
- Главный следователь: Qingli Zhu, MD, Peking Union Medical College Hospital
Публикации и полезные ссылки
Общие публикации
- Sung H, Ferlay J, Siegel RL, Laversanne M, Soerjomataram I, Jemal A, Bray F. Global Cancer Statistics 2020: GLOBOCAN Estimates of Incidence and Mortality Worldwide for 36 Cancers in 185 Countries. CA Cancer J Clin. 2021 May;71(3):209-249. doi: 10.3322/caac.21660. Epub 2021 Feb 4.
- Bi WL, Hosny A, Schabath MB, Giger ML, Birkbak NJ, Mehrtash A, Allison T, Arnaout O, Abbosh C, Dunn IF, Mak RH, Tamimi RM, Tempany CM, Swanton C, Hoffmann U, Schwartz LH, Gillies RJ, Huang RY, Aerts HJWL. Artificial intelligence in cancer imaging: Clinical challenges and applications. CA Cancer J Clin. 2019 Mar;69(2):127-157. doi: 10.3322/caac.21552. Epub 2019 Feb 5.
- Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, Ghassemi M, Liu X, Reitsma JB, van Smeden M, Boulesteix AL, Camaradou JC, Celi LA, Denaxas S, Denniston AK, Glocker B, Golub RM, Harvey H, Heinze G, Hoffman MM, Kengne AP, Lam E, Lee N, Loder EW, Maier-Hein L, Mateen BA, McCradden MD, Oakden-Rayner L, Ordish J, Parnell R, Rose S, Singh K, Wynants L, Logullo P. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024 Apr 16;385:e078378. doi: 10.1136/bmj-2023-078378.
- Benary M, Wang XD, Schmidt M, Soll D, Hilfenhaus G, Nassir M, Sigler C, Knodler M, Keller U, Beule D, Keilholz U, Leser U, Rieke DT. Leveraging Large Language Models for Decision Support in Personalized Oncology. JAMA Netw Open. 2023 Nov 1;6(11):e2343689. doi: 10.1001/jamanetworkopen.2023.43689.
- Bhayana R, Krishna S, Bleakney RR. Performance of ChatGPT on a Radiology Board-style Examination: Insights into Current Strengths and Limitations. Radiology. 2023 Jun;307(5):e230582. doi: 10.1148/radiol.230582. Epub 2023 May 16.
- Clusmann J, Kolbinger FR, Muti HS, Carrero ZI, Eckardt JN, Laleh NG, Loffler CML, Schwarzkopf SC, Unger M, Veldhuizen GP, Wagner SJ, Kather JN. The future landscape of large language models in medicine. Commun Med (Lond). 2023 Oct 10;3(1):141. doi: 10.1038/s43856-023-00370-1.
- Seyyed-Kalantari L, Zhang H, McDermott MBA, Chen IY, Ghassemi M. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021 Dec;27(12):2176-2182. doi: 10.1038/s41591-021-01595-0. Epub 2021 Dec 10.
- Moor M, Banerjee O, Abad ZSH, Krumholz HM, Leskovec J, Topol EJ, Rajpurkar P. Foundation models for generalist medical artificial intelligence. Nature. 2023 Apr;616(7956):259-265. doi: 10.1038/s41586-023-05881-4. Epub 2023 Apr 12.
- Miaojiao S, Xia L, Xian Tao Z, Zhi Liang H, Sheng C, Songsong W. Using a Large Language Model for Breast Imaging Reporting and Data System Classification and Malignancy Prediction to Enhance Breast Ultrasound Diagnosis: Retrospective Study. JMIR Med Inform. 2025 Jun 11;13:e70924. doi: 10.2196/70924.
- Jiao J, Zhou J, Li X, Xia M, Huang Y, Huang L, Wang N, Zhang X, Zhou S, Wang Y, Guo Y. USFM: A universal ultrasound foundation model generalized to tasks and organs towards label efficient image analysis. Med Image Anal. 2024 Aug;96:103202. doi: 10.1016/j.media.2024.103202. Epub 2024 May 15.
- Xiang H, Wang X, Xu M, Zhang Y, Zeng S, Li C, Liu L, Deng T, Tang G, Yan C, Ou J, Lin Q, He J, Sun P, Li A, Chen H, Heng PA, Lin X. Deep Learning-assisted Diagnosis of Breast Lesions on US Images: A Multivendor, Multicenter Study. Radiol Artif Intell. 2023 Jul 12;5(5):e220185. doi: 10.1148/ryai.220185. eCollection 2023 Sep.
- Kottlors J, Iuga AI, Bluethgen C, Bressem K, Kather JN, Moy L, Wald C, Wang W, Liu T, Ranschaert E, Dratsch T, Kleesiek J, Gertz RJ, Rajpurkar P, Bedayat A, Fink MA, Zeeck A, Chaudhari A, Alkasab T, Wu H, Nensa F, Wang B, Grosse Hokamp N, Laukamp KR, Persigehl T, Maintz D, Truhn D, Lennartz S. Guidelines for Reporting Studies on Large Language Models in Radiology: An International Delphi Expert Survey. Radiology. 2026 Feb;318(2):e250913. doi: 10.1148/radiol.250913.
Даты записи исследования
Изучение основных дат
Начало исследования (Действительный)
Первичное завершение (Оцененный)
Завершение исследования (Оцененный)
Даты регистрации исследования
Первый отправленный
Впервые представлено, что соответствует критериям контроля качества
Первый опубликованный (Действительный)
Обновления учебных записей
Последнее опубликованное обновление (Действительный)
Последнее отправленное обновление, отвечающее критериям контроля качества
Последняя проверка
Дополнительная информация
Термины, связанные с этим исследованием
Ключевые слова
Дополнительные соответствующие термины MeSH
Другие идентификационные номера исследования
- K10349
- 2024-I2M-CT-B-035 (Другой номер гранта/финансирования: CAMS Innovation Fund for Medical Sciences)
- I-26PJ0568 (Другой идентификатор: Ethics Committee, Peking Union Medical College Hospital)
Планирование данных отдельных участников (IPD)
Планируете делиться данными об отдельных участниках (IPD)?
Описание плана IPD
Сроки обмена IPD
Критерии совместного доступа к IPD
Совместное использование IPD Поддерживающий тип информации
- STUDY_PROTOCOL
- САП
- АНАЛИТИЧЕСКИЙ_КОД
Информация о лекарствах и устройствах, исследовательские документы
Изучает лекарственный продукт, регулируемый FDA США.
Изучает продукт устройства, регулируемый Управлением по санитарному надзору за качеством пищевых продуктов и медикаментов США.
Эта информация была получена непосредственно с веб-сайта clinicaltrials.gov без каких-либо изменений. Если у вас есть запросы на изменение, удаление или обновление сведений об исследовании, обращайтесь по адресу register@clinicaltrials.gov. Как только изменение будет реализовано на clinicaltrials.gov, оно будет автоматически обновлено и на нашем веб-сайте. .