Эта страница была переведена автоматически, точность перевода не гарантируется. Пожалуйста, обратитесь к английской версии для исходного текста.

Обогащение Рассуждений с Обратной Связью от ИИ в Нефрологическом Исследовании (REFINe)

12 января 2026 г. обновлено: Aghiles.HAMROUN, University Hospital, Lille

Улучшение диагностических способностей с использованием обратной связи от генеративного искусственного интеллекта в нефрологии (REFINe): рандомизированная оценка поддержки генеративного ИИ при диагностике нефрологических заболеваний

Цель этого клинического исследования — изучить, как искусственный интеллект (ИИ) может помочь врачам в постановке диагнозов в нефрологии. Исследователи хотят узнать, может ли инструмент ИИ, называемый большой языковой моделью (LLM), помочь врачам чаще выбирать правильный диагноз и чувствовать себя более уверенно в своих ответах.

Перед началом исследования команда протестировала несколько моделей ИИ и выбрала одну из лучших — модель класса GPT-5, настроенную на использование высоких вычислительных ресурсов для рассуждений.

Основные вопросы, на которые направлено данное исследование:

  1. Ставят ли врачи больше правильных диагнозов, когда видят предложения ИИ?
  2. Влияет ли просмотр предложений ИИ на уверенность врачей в своём диагнозе?

Исследователи сравнят врачей, получающих предложения ИИ, с врачами, не получающими их, чтобы оценить влияние ИИ на точность, уверенность и принятие решений.

Участники выполнят до 10 онлайн клинических случаев. Для каждого случая они:

  1. Прочитают краткое медицинское описание
  2. Предложат до трёх возможных диагнозов

(Если в группе с ИИ) Просмотрят предложения ИИ и решат, изменить ли свой ответ

Исследование также оценит, сколько времени участники тратят на каждый случай, и сравнит производительность ИИ с ответами людей.

Обзор исследования

Подробное описание

В данном исследовании оценивается, улучшает ли предоставление клиницистам диагностических предложений в реальном времени от высоко-рассуждающей большой языковой модели (GPT-5) точность, уверенность и эффективность диагностики при решении нефрологических клинических виньеток. Перед выбором модели для испытания исследовательская группа провела сравнительный анализ нескольких современных моделей на пилотном наборе нефрологических случаев, включая: GPT-5, GPT-5-mini, O3, GPT-4o, Llama-4 Maverick-17B, Gemini-2.5-Pro, Qwen-3 VL-235B Thinking, DeepSeek-V3.2-Exp, MedGEMMA-27B, Claude Sonnet-4.5 и Magistral-Medium-2509. GPT-5 (высоко-рассуждающая) продемонстрировала наивысшую диагностическую эффективность, стабильность и интерпретируемость и была выбрана в качестве ИИ-системы, используемой в интервенционной группе.

Участники включают студентов-медиков, ординаторов, стажеров и практикующих врачей. После создания учетной записи участники заполняют демографический опросник (специальность, стаж, тип практики, возрастная категория, знакомство с ИИ) и должны явно согласиться на использование этих данных в исследовательских целях перед доступом к виньеткам. Прямая идентифицирующая информация не собирается.

Участники рандомизируются (со стратификацией по профессиональному статусу) либо в группу с поддержкой ИИ, либо в контрольную группу. Каждому участнику назначается 10 нефрологических виньеток на французском или английском языке, и они могут выполнять их в течение нескольких сессий. После отправки виньетка не может быть повторно открыта ("без возврата"). Время выполнения каждой виньетки автоматически фиксируется.

Контрольная группа

Участники просматривают каждую виньетку и предоставляют до трех диагнозов ("Топ-3"), после чего указывают уровень уверенности (0-10).

Группа с поддержкой ИИ

Участники сначала вводят первоначальные Топ-3 диагнозы и уровень уверенности без помощи ИИ. Затем система отображает диагностические предложения GPT-5, после чего участники могут один раз пересмотреть свои диагнозы. Виньетка блокируется после отправки.

Исследование собирает:

  • первоначальные и окончательные диагнозы,
  • уровни уверенности до и (если применимо) после предложений ИИ,
  • время выполнения,
  • демографические переменные участников,
  • и собственные диагностические выводы модели ИИ.

Частичное выполнение разрешено; все завершенные виньетки вносят вклад в анализ.

Первичные и вторичные исходы включают точность диагностики (Топ-3 и Топ-1), улучшение точности до и после ИИ, изменения в диагностической уверенности, диагностические ошибки, вызванные ИИ, сравнение человека и ИИ, метрики эффективности по времени выполнения и долю выполненных назначенных виньеток.

Первичный анализ будет сравнивать точность диагностики между контрольной группой (врачи самостоятельно) и экспериментальной группой (врачи с помощью модели ИИ). Точность анализируется как бинарный исход (правильный vs неправильный диагноз). Поскольку каждый участник оценивает несколько клинических виньеток, точность будет моделироваться с использованием смешанной логистической регрессии с фиксированным эффектом для группы исследования и случайными пересечениями как для участника, так и для виньетки. Этот подход учитывает кластеризацию и различную сложность случаев. Первичная проверка гипотезы использует двусторонний α = 0,05. Размеры эффекта будут представлены как отношения шансов с 95% доверительными интервалами. Вторичные анализы будут исследовать, варьируется ли точность в зависимости от демографических факторов (например, уровень опыта, специальность) с использованием членов взаимодействия.

Поскольку каждый участник оценивает несколько виньеток, команда также провела анализ мощности на основе симуляций с использованием моделей смешанной логистической регрессии со случайными пересечениями как для участника, так и для виньетки, предполагая внутри-участниковый ICC 0,10. При этих предположениях общая выборка из 100 участников (50 на группу) с 10 виньетками на участника обеспечивает >99% мощности для обнаружения клинически значимого улучшения точности диагностики. Следовательно, исследователи планируют набрать в общей сложности примерно 100 участников.

Данное исследование направлено на количественную оценку того, улучшает ли ИИ-усиленное рассуждение диагностическую эффективность и принятие решений, когда клиницисты оценивают сложные нефрологические случаи.

Тип исследования

Интервенционный

Регистрация (Оцененный)

100

Фаза

  • Непригодный

Контакты и местонахождение

В этом разделе приведены контактные данные лиц, проводящих исследование, и информация о том, где проводится это исследование.

Контакты исследования

Места учебы

Критерии участия

Исследователи ищут людей, которые соответствуют определенному описанию, называемому критериям приемлемости. Некоторыми примерами этих критериев являются общее состояние здоровья человека или предшествующее лечение.

Критерии приемлемости

Возраст, подходящий для обучения

  • Взрослый
  • Пожилой взрослый

Принимает здоровых добровольцев

Да

Описание

Критерии включения:

Взрослые в возрасте 18 лет и старше.

Способность читать и отвечать на клинические виньетки на английском или французском языке.

Доступ к компьютеру или смартфону с подключением к интернету.

Предоставление информированного согласия онлайн.

Ожидается, что участники будут иметь как минимум базовую медицинскую подготовку (например, студенты-медики, ординаторы, стипендиаты или практикующие врачи), хотя формальная проверка не требуется.

Критерии исключения:

Лица младше 18 лет.

Невозможность выполнения онлайн-процедур исследования.

Предыдущее участие в разработке, создании или оценке системы искусственного интеллекта, используемой в данном исследовании.

Учебный план

В этом разделе представлена ​​подробная информация о плане исследования, в том числе о том, как планируется исследование и что оно измеряет.

Как устроено исследование?

Детали дизайна

  • Основная цель: Диагностика
  • Распределение: Рандомизированный
  • Интервенционная модель: Параллельное назначение
  • Маскировка: Нет (открытая этикетка)

Оружие и интервенции

Группа участников / Армия
Вмешательство/лечение
Экспериментальный: Группа с предложениями ИИ
Участники в этой группе будут решать те же клинические кейсы, что и контрольная группа. Для каждого случая они получат предложенный диагноз, сгенерированный большой языковой моделью (GPT-5, конфигурация с высоким уровнем логического мышления), который был выбран в результате внутреннего тестирования. Участники могут ознакомиться с предложением ИИ перед тем, как ввести свой окончательный диагностический ответ. Дополнительная информация, подсказки или инструкции не предоставляются. Вмешательство заключается исключительно в отображении сгенерированного ИИ диагностического предложения во время выполнения задачи по решению клинического случая.
Это вмешательство заключается в отображении сгенерированного искусственным интеллектом диагностического предположения во время решения клинического случая. После прочтения каждого клинического описания участники видят лучший диагностический вариант, предложенный большой языковой моделью (GPT-5, конфигурация с высоким уровнем рассуждений), выбранный после внутреннего тестирования. Предложение ИИ появляется один раз для каждого клинического описания и не может быть запрошено повторно или изменено. Участники могут пересмотреть свой диагностический ответ после просмотра предложения, но они не могут вернуться к клиническому описанию позже. Дополнительные инструкции, наставления или интерактивные функции не предоставляются.
Без вмешательства: Группа без предложений ИИ
Участники в этой группе будут самостоятельно заполнять клинические кейс-виньетки без каких-либо диагностических предложений, сгенерированных ИИ. Они будут читать каждую виньетку и предоставлять собственный диагностический ответ, основываясь исключительно на представленной информации. Внешняя поддержка принятия решений или дополнительные материалы не предоставляются.

Что измеряет исследование?

Первичные показатели результатов

Мера результата
Мера Описание
Временное ограничение
Окончательная диагностическая точность (топ-3) с поддержкой ИИ и без нее
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).

Для каждого участника — доля виньеток, где правильный основной диагноз включён в итоговые топ-3 диагноза участника. Сравнить итоговую точность топ-3 между группой ИИ (после предложений ИИ) и контрольной группой (без ИИ).

Процент правильно диагностированных случаев (топ-3).

С момента ответа на первый виньет до конца исследования (до 12 месяцев).

Вторичные показатели результатов

Мера результата
Мера Описание
Временное ограничение
Окончательная точность диагностики (топ-1) с поддержкой ИИ и без неё
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Для каждого участника – доля виньеток, в которых правильный основной диагноз включен в финальный топ-1 диагнозов участника. Сравните финальную точность топ-1 между группой ИИ (после предложений ИИ) и контрольной группой (без ИИ). Процент правильно диагностированных случаев (топ-1).
С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Изменение точности диагностики по топ-3 до и после предложений ИИ (только группа с ИИ)
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).

В группе с поддержкой ИИ участники сначала дают первоначальный ответ (до трёх диагнозов) без предложений ИИ, затем видят сгенерированные ИИ предложения и могут один раз скорректировать свой ответ; позже вернуться к этому клиническому случаю они не могут. Для каждого участника исследователи вычисляют разницу в точности первых трёх диагнозов между первоначальными и окончательными ответами по всем завершённым клиническим случаям.

Изменение точности первых трёх диагнозов в процентных пунктах

С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Изменение точности top-1 диагностики до и после предложений ИИ (только группа ИИ)
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).

В группе с поддержкой ИИ участники сначала дают первоначальный ответ (до трёх диагнозов) без предложений ИИ, затем видят предложения, сгенерированные ИИ, и могут один раз скорректировать свой ответ; вернуться к этому клиническому случаю позже они не могут. Для каждого участника исследователи вычисляют разницу в точности топ-1 между первоначальными и окончательными ответами по всем завершённым клиническим случаям.

Изменение точности топ-1 диагностики в процентных пунктах

С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Диагностическая уверенность (0-10) до предложений ИИ: Контрольная группа vs группа ИИ
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).

Участники в обеих группах оценивают свою уверенность (по шкале от 0 до 10) в своих трёх лучших диагностических предложениях до любых предложений ИИ.

В группе ИИ это оценка «до ИИ». В контрольной группе это единственная оценка уверенности (поскольку ИИ не показывается).

Исследователи сравнивают уверенность до ИИ между группами, агрегированную по всем завершённым виньеткам на участника.

С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Итоговая диагностическая уверенность (0-10) после предложений ИИ: Контрольная группа vs группа ИИ
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).

Итоговая диагностическая уверенность (шкала 0-10) в трёх лучших диагностических предложениях по всем завершённым виньеткам, сравнивается между группами.

В группе ИИ это оценка уверенности после получения рекомендаций ИИ. В контрольной группе это та же оценка уверенности (участники не получают рекомендации ИИ).

С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Изменение диагностической уверенности (0-10) до и после предложений ИИ (только в группе ИИ)
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).

В группе с использованием ИИ участники предоставляют оценки уверенности (по шкале от 0 до 10) для своих трёх основных диагнозов как до, так и после просмотра предложений ИИ.

Для каждого участника исследователи рассчитывают внутрииндивидуальное изменение (после ИИ минус до ИИ) по всем завершённым виньеткам.

Изменение оценки уверенности (по шкале от 0 до 10)

С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Диагностическая ошибка, вызванная искусственным интеллектом (только группа ИИ)
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Среди завершенных виньеток, в которых первоначальный диагноз участника Топ-1 является верным, доля тех, в которых окончательный диагноз Топ-1 становится неверным после предложений ИИ.
С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Изменение в трёх основных диагнозах после предложений ИИ (только группа ИИ)
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Среди завершенных виньеток в группе ИИ доля случаев, когда топ-3 диагнозов различается между ответами до и после применения ИИ.
С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Топ-3 диагностическая точность: Все человеческие ответы до ИИ против точности ИИ
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).

Для каждого виньетки точность диагностики Топ-3 участников-людей до любых предложений ИИ (объединяя участников из обеих групп исследования на их пред-ИИ стадии) сравнивается с точностью диагностики Топ-3 модели ИИ для той же виньетки. Сообщаемый результат — это разница в точности, определяемая как точность Топ-3 ИИ минус точность Топ-3 людей до ИИ, выраженная в процентных пунктах и вычисленная на уровне виньетки по всем завершённым виньеткам.

Разница в процентных пунктах в точности диагностики Топ-3

С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Топ-3 диагностическая точность: Итоговые ответы человека после ИИ против точности ИИ (только группа ИИ)
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).

Для каждого виньетки, выполненной в группе с поддержкой ИИ, точность диагнозов в топ-3 участников-людей после просмотра предложений ИИ сравнивается с точностью диагнозов в топ-3 модели ИИ.

(Точность в топ-3 — единый показатель) Сообщаемый результат — разница в точности, определяемая как точность ИИ в топ-3 минус точность человека после ИИ в топ-3, выраженная в процентных пунктах и вычисленная на уровне виньетки по всем выполненным виньеткам в группе ИИ.

Разница в процентных пунктах в точности диагнозов в топ-3 между ИИ и человеком

С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Время выполнения каждого виньетки с поддержкой ИИ и без
Временное ограничение: С момента ответа на первый виньет до конца исследования (до 12 месяцев).

Для каждого виньетки платформа записывает время от открытия виньетки до отправки ответа. В контрольной группе для каждой виньетки записывается одно время выполнения. В группе с поддержкой ИИ время выполнения записывается до просмотра предложений ИИ и снова после просмотра предложений ИИ. В результатах указывается разница во времени выполнения между исследуемыми группами, выраженная в секундах и рассчитанная по всем завершенным виньеткам.

Секунды (разница во времени выполнения)

С момента ответа на первый виньет до конца исследования (до 12 месяцев).
Доля назначенных виньеток, завершенных
Временное ограничение: С момента ответа на первый виньетный вопрос до окончания исследования (до 12 месяцев).
Для каждого участника доля из 10 виньеток, завершенных в течение периода исследования, сравнивается между группами.
С момента ответа на первый виньетный вопрос до окончания исследования (до 12 месяцев).

Соавторы и исследователи

Здесь вы найдете людей и организации, участвующие в этом исследовании.

Даты записи исследования

Эти даты отслеживают ход отправки отчетов об исследованиях и сводных результатов на сайт ClinicalTrials.gov. Записи исследований и сообщаемые результаты проверяются Национальной медицинской библиотекой (NLM), чтобы убедиться, что они соответствуют определенным стандартам контроля качества, прежде чем публиковать их на общедоступном веб-сайте.

Изучение основных дат

Начало исследования (Действительный)

20 ноября 2025 г.

Первичное завершение (Оцененный)

31 октября 2026 г.

Завершение исследования (Оцененный)

31 декабря 2026 г.

Даты регистрации исследования

Первый отправленный

19 ноября 2025 г.

Впервые представлено, что соответствует критериям контроля качества

12 января 2026 г.

Первый опубликованный (Действительный)

20 января 2026 г.

Обновления учебных записей

Последнее опубликованное обновление (Действительный)

20 января 2026 г.

Последнее отправленное обновление, отвечающее критериям контроля качества

12 января 2026 г.

Последняя проверка

1 января 2026 г.

Дополнительная информация

Термины, связанные с этим исследованием

Информация о лекарствах и устройствах, исследовательские документы

Изучает лекарственный продукт, регулируемый FDA США.

Нет

Изучает продукт устройства, регулируемый Управлением по санитарному надзору за качеством пищевых продуктов и медикаментов США.

Нет

Эта информация была получена непосредственно с веб-сайта clinicaltrials.gov без каких-либо изменений. Если у вас есть запросы на изменение, удаление или обновление сведений об исследовании, обращайтесь по адресу register@clinicaltrials.gov. Как только изменение будет реализовано на clinicaltrials.gov, оно будет автоматически обновлено и на нашем веб-сайте. .

Подписаться