- ICH GCP
- Реестр клинических исследований США
- Клиническое испытание NCT07328815
Смягчение автоматического смещения в диагностических рассуждениях врачей и языковых моделей с использованием поведенческих подсказок
Смягчение автоматической предвзятости в диагностических рассуждениях врачей с использованием ИЯ-моделей посредством поведенческих подсказок
Цель этого рандомизированного контролируемого исследования — оценить, могут ли поведенческие подсказки уменьшить автоматизационное смещение — некритическое принятие автоматизированных выводов — у врачей, использующих большие языковые модели (LLM), такие как ChatGPT-5.1, для принятия клинических решений.
Основной вопрос, на который оно направлено ответить: Уменьшает ли двойной механизм поведенческой подсказки (якорение базовой точности плюс кодированные цветом сигналы уверенности для конкретных случаев) некритическое принятие врачами некорректных рекомендаций LLM?
Исследователи сравнят врачей, получающих рекомендации LLM вместе с поведенческой подсказкой, с теми, кто получает рекомендации LLM без подсказки, чтобы оценить, уменьшает ли подсказка автоматизационное смещение.
Участники будут:
- Оценивать шесть клинических виньеток, сопровождаемых рекомендациями, сгенерированными LLM (половина из которых содержит преднамеренные, клинически значимые ошибки).
- Контрольная группа: Иметь возможность просматривать рекомендации LLM в стандартном формате без подсказки.
- Экспериментальная группа: Иметь возможность просматривать диагностическую точность ChatGPT на стандартных медицинских наборах данных в качестве начального якоря, затем получать кодированные цветом сигналы уверенности вместе с каждой рекомендацией (например, красный для низкой уверенности).
- Иметь свои ответы, оцененные слепыми рецензентами с использованием экспертно разработанной оценочной рубрики для выявления некритического принятия ошибочной информации.
Обзор исследования
Статус
Условия
Вмешательство/лечение
Подробное описание
Предвзятость автоматизации представляет собой критическую проблему в современной клинической практике, особенно по мере того, как инструменты искусственного интеллекта (ИИ) всё больше внедряются в рабочие процессы здравоохранения. Это когнитивное явление описывает склонность клиницистов отдавать предпочтение предложениям автоматизированных систем принятия решений, даже когда эти предложения являются неверными. По мере того как большие языковые модели (БЯМ), такие как ChatGPT-5.1, набирают популярность в медицинских учреждениях, их потенциал по снижению ошибок и повышению эффективности должен быть сопоставлен со значительной проблемой: эти модели не прошли строгой медицинской валидации и могут усиливать существующие когнитивные искажения через неверные или вводящие в заблуждение рекомендации.
Появление предвзятости автоматизации в медицинском контексте отражает сложное взаимодействие экологических и психологических факторов. Временные ограничения в условиях высокой клинической нагрузки создают давление, заставляющее принимать рекомендации, сгенерированные ИИ, без должной проверки. Финансовые стимулы, которые ставят во главу угла эффективность, а не тщательность, могут ещё больше препятствовать критической оценке, необходимой для обоснованного клинического суждения. Когнитивная усталость во время продолжительных смен снижает способность врачей к устойчивому аналитическому мышлению. Эти давления взаимодействуют с психологическими механизмами, включая диффузию ответственности, излишнюю уверенность в технологических решениях и когнитивную разгрузку, совместно создавая условия, при которых некритическое принятие рекомендаций, сгенерированных ИИ, становится более вероятным.
В этом рандомизированном контролируемом исследовании оценивается эффективность поведенческого «подталкивания» (nudge), предназначенного для смягчения предвзятости автоматизации среди врачей, использующих диагностические рекомендации, сгенерированные БЯМ. Основная цель — определить, улучшает ли это вмешательство показатели эффективности диагностического мышления при оценке клинических виньеток, которые включают намеренно ошибочные рекомендации БЯМ. Вторичные цели включают оценку того, влияют ли уровень опыта врача, пол и предыдущий опыт работы с БЯМ на эффективность вмешательства, а также определение дифференциальной эффективности для виньеток с разными сигналами уверенности.
В этом исследовании используется однослепое рандомизированное контролируемое исследование с двумя параллельными группами. Участники будут случайным образом распределены в соотношении 1:1 либо в группу вмешательства, либо в контрольную группу. Чтобы исключить изменчивость из-за различий в навыках формулирования запросов, участники не будут напрямую взаимодействовать с живым интерфейсом БЯМ. Вместо этого все участники будут использовать специально созданную веб-платформу, отображающую клинические виньетки с заранее сгенерированными рекомендациями БЯМ, что обеспечивает идентичный контент, сгенерированный БЯМ, для каждой виньетки.
Все участники оценят шесть клинических виньеток в течение одного прокторируемого сеанса продолжительностью приблизительно 75 минут. Три виньетки будут содержать намеренно внесённые ошибки клинического мышления в рекомендациях БЯМ, а три будут содержать правильные рекомендации. Виньетки будут представлены в случайном порядке, чтобы предотвратить обнаружение закономерностей.
Участники контрольной группы будут оценивать клинические виньетки с диагностическими рекомендациями БЯМ, сгенерированными ChatGPT, представленными в стандартном, нейтральном текстовом формате без дополнительной контекстной информации. Участники группы вмешательства будут оценивать те же виньетки вместе с поведенческим «подталкиванием». Это вмешательство состоит из двух синхронизированных когнитивных сигналов: (1) сигнал привязки (anchoring cue), отображающий базовую диагностическую точность ChatGPT на стандартных медицинских наборах данных в верхней части панели интерфейса, явно привязывающий ожидания к ошибочности модели, и (2) сигнал избирательного внимания (selective attention cue), отображающий рекомендацию БЯМ вместе с цветовым кодированным сигналом уверенности, сгенерированным через ансамблевую оценку: три независимые передовые БЯМ (Claude Sonnet 4.5, Gemini 2.5 Pro Thinking и GPT-5.1) предоставляют рейтинги уверенности для рекомендации, и средняя уверенность определяет цвет сигнала, чтобы смягчить ошибку калибровки отдельной модели.
Цветовые кодированные сигналы уверенности разделены на три различных уровня на основе средней уверенности ансамбля относительно базовой диагностической точности. Красные сигналы срабатывают, когда средняя уверенность падает ниже установленной базовой точности ChatGPT, явно помечая случаи с высокой неопределённостью, которые требуют повышенного критического внимания. Оранжевые сигналы указывают, что хотя средняя уверенность превышает базовый средний показатель, она остаётся ниже 100%, сигнализируя о необходимости продолжения клинической бдительности и избегания самоуспокоенности. Наконец, зелёные сигналы зарезервированы для случаев 100% консенсуса ансамбля; однако даже при таком уровне уверенности стандартные предупреждения о безопасности ИИ остаются присутствующими, чтобы защитить от чрезмерной зависимости от вывода системы.
Участникам будут представлены шесть клинических виньеток, специально разработанных для измерения предвзятости автоматизации, взятых и модифицированных из реальных случаев, представляющих диапазон диагностической сложности и распространённые медицинские специальности. Каждая виньетка следует стандартизированному формату, включая основную жалобу, историю настоящего заболевания, соответствующий прошлый медицинский/социальный/семейный анамнез, данные физикального обследования и первоначальные результаты лабораторных исследований.
Основной исход — это показатель эффективности диагностического мышления (Diagnostic Reasoning Performance Score), составной процентный показатель, основанный на структурированной рубрике, оценивающей: качество дифференциальных диагнозов, подтверждающие данные, опровергающие данные, точность окончательного диагноза и уместность следующих шагов. Вторичные исходы включают точность диагноза первого выбора (неверный, частично верный или верный). Все ответы будут оценены слепыми рецензентами с использованием оценочной рубрики.
Тип исследования
Регистрация (Действительный)
Фаза
- Непригодный
Контакты и местонахождение
Места учебы
-
-
Punjab Province
-
Lahore, Punjab Province, Пакистан, 54792
- Lahore University of Management Sciences
-
-
Критерии участия
Критерии приемлемости
Возраст, подходящий для обучения
- Ребенок
- Взрослый
- Пожилой взрослый
Принимает здоровых добровольцев
Описание
Критерии включения:
- Врачи с полной или временной регистрацией в Пакистанском медицинском и стоматологическом совете (PMDC).
- Завершившие экзамен на степень бакалавра медицины и бакалавра хирургии (MBBS). Эквивалентная степень MBBS в США и Канаде — доктор медицины (MD).
- Участники должны пройти структурированную программу обучения использованию ChatGPT (или аналогичной большой языковой модели) общей продолжительностью не менее 10 часов. Программа должна включать практические занятия по ключевым аспектам LLM, в частности по инженерии промптов и оценке контента.
Критерии исключения:
- Любые другие зарегистрированные врачи (полная или временная регистрация) в PMDC (например, специалисты со степенью бакалавра стоматологической хирургии или BDS).
Учебный план
Как устроено исследование?
Детали дизайна
- Основная цель: Диагностика
- Распределение: Рандомизированный
- Интервенционная модель: Параллельное назначение
- Маскировка: Одинокий
Оружие и интервенции
Группа участников / Армия |
Вмешательство/лечение |
|---|---|
|
Активный компаратор: Рекомендации ChatGPT в сочетании с поведенческим подталкиванием
Участники оценят шесть клинических виньеток.
В ходе испытания у них будет доступ к клиническим рекомендациям от конкретного, коммерчески доступного LLM (ChatGPT) в дополнение к традиционным диагностическим ресурсам.
Рекомендации LLM для трех виньеток будут содержать намеренно ошибочную диагностическую информацию, а для трех виньеток — точные рекомендации.
Случаи будут представлены в случайном порядке.
Участники этой группы получат поведенческий стимул, встроенный в интерфейс рекомендаций LLM, который представляет два синхронизированных когнитивных сигнала при раскрытии панели LLM: (1) сигнал привязки, отображающий базовую диагностическую точность ChatGPT на стандартных медицинских наборах данных в верхней части панели, чтобы установить реалистичные ожидания перед вмешательством сигнала, расположенным непосредственно ниже, который показывает рекомендации LLM вместе с цветовым сигналом уверенности, специфичным для случая.
|
Участники в группе лечения получат поведенческое подталкивающее вмешательство, встроенное в интерфейс рекомендаций LLM, которое представляет два синхронизированных когнитивных сигнала при раскрытии панели LLM: (1) якорный сигнал, отображающий базовую диагностическую точность ChatGPT на стандартных медицинских наборах данных в верхней части панели, чтобы установить реалистичные ожидания перед просмотром конкретной рекомендации, и (2) сигнал избирательного внимания, расположенный непосредственно ниже, который показывает рекомендацию LLM вместе с зависящим от случая и цветовым кодированным сигналом уверенности.
Этот сигнал классифицируется как красный, когда средняя ансамблевая уверенность падает ниже установленной базовой точности, отмечая случаи с высокой неопределенностью, требующие критической оценки; оранжевый, когда уверенность соответствует или превышает базовую, но остается ниже 100%, предназначенный для предотвращения самоуспокоенности и поддержания активного клинического контроля; и зеленый для 100% консенсуса ансамбля, хотя стандартные предупреждения о мерах предосторожности все еще применяются для защиты.
|
|
Без вмешательства: Рекомендации ChatGPT без поведенческого подталкивания
Участники оценят шесть клинических виньеток.
Во время исследования у них будет доступ к клиническим рекомендациям от конкретного, коммерчески доступного LLM (ChatGPT) в дополнение к традиционным диагностическим ресурсам.
Рекомендации LLM для трех виньеток будут содержать намеренно ошибочную диагностическую информацию.
Случаи будут представлены в случайном порядке.
Участники в этой группе не получат никаких поведенческих подсказок.
|
Что измеряет исследование?
Первичные показатели результатов
Мера результата |
Мера Описание |
Временное ограничение |
|---|---|---|
|
Оценка точности диагностического рассуждения
Временное ограничение: Оценивалось в один момент времени для каждого случая во время запланированного сеанса оценки диагностического обоснования, который проводится в период от 0 до 5 дней после включения участника.
|
Основным результатом будет процент правильных ответов для каждого случая, варьирующийся от 0 до 100%, где более высокие баллы указывают на лучшую диагностическую эффективность.
Для каждого случая участникам будет предложено назвать три основных диагноза, данные, подтверждающие каждый диагноз, и данные, противоречащие каждому диагнозу.
За каждый правдоподобный диагноз участники получат 1 балл.
Данные, подтверждающие диагноз, и данные, противоречащие диагнозу, также будут оцениваться по правильности, с 1 баллом за каждый правильный ответ.
Затем участникам будет предложено назвать их основной диагноз, который, по их мнению, наиболее вероятен, получая 9 баллов за разумный ответ и 18 баллов за наиболее точный ответ.
Наконец, участникам будет предложено назвать до 3 следующих шагов для дальнейшего обследования пациента, с начислением 0,5 балла за частично правильный ответ и 1 балла за полностью правильный ответ.
Основной результат будет сравниваться на уровне случая между рандомизированными группами.
|
Оценивалось в один момент времени для каждого случая во время запланированного сеанса оценки диагностического обоснования, который проводится в период от 0 до 5 дней после включения участника.
|
Вторичные показатели результатов
Мера результата |
Мера Описание |
Временное ограничение |
|---|---|---|
|
Наивысший показатель точности диагностики
Временное ограничение: Оценивается в единую временную точку для каждого случая во время планового сеанса оценки диагностического обоснования, который проводится в течение 0–5 дней после включения участника в исследование.
|
Вторичный исход будет измерять эффективность участников в определении наиболее вероятного диагноза для каждого клинического виньетка.
После оценки каждого случая участники выберут единственный наиболее вероятный диагноз, который будет оцениваться по заранее определенной трехуровневой шкале диагностической точности: 18 баллов за наиболее точный диагноз, 9 баллов за клинически разумную альтернативу и 0 баллов за неверный диагноз.
Для каждого участника рассчитывается показатель точности основного выбора диагноза как (общее количество набранных баллов ÷ максимально возможное количество баллов) × 100, что дает диапазон от 0 до 100%, где более высокие баллы указывают на большую диагностическую точность.
Этот процентный показатель будет сравниваться на уровне случаев между рандомизированными группами для количественной оценки влияния автоматического смещения на принятие диагностических решений.
|
Оценивается в единую временную точку для каждого случая во время планового сеанса оценки диагностического обоснования, который проводится в течение 0–5 дней после включения участника в исследование.
|
Соавторы и исследователи
Следователи
- Главный следователь: Muhammad Asadullah Khawaja, MBBS, King Edward Medical University
- Главный следователь: Ihsan Ayyub Qazi, PhD, Lahore University of Management Sciences (LUMS)
- Главный следователь: Ali Zafar Sheikh, MBBS, Lahore General Hospital
- Главный следователь: Muhammad Junaid Akhtar, MBBS, Children's Hospital, Lahore
- Главный следователь: Muhammad Hamad Alizai, PhD, Lahore University of Management Sciences (LUMS)
Даты записи исследования
Изучение основных дат
Начало исследования (Действительный)
Первичное завершение (Действительный)
Завершение исследования (Действительный)
Даты регистрации исследования
Первый отправленный
Впервые представлено, что соответствует критериям контроля качества
Первый опубликованный (Действительный)
Обновления учебных записей
Последнее опубликованное обновление (Действительный)
Последнее отправленное обновление, отвечающее критериям контроля качества
Последняя проверка
Дополнительная информация
Термины, связанные с этим исследованием
Ключевые слова
Дополнительные соответствующие термины MeSH
Другие идентификационные номера исследования
- LUMS-IRB-0412/12192025/IAQ-FWA
Планирование данных отдельных участников (IPD)
Планируете делиться данными об отдельных участниках (IPD)?
Информация о лекарствах и устройствах, исследовательские документы
Изучает лекарственный продукт, регулируемый FDA США.
Изучает продукт устройства, регулируемый Управлением по санитарному надзору за качеством пищевых продуктов и медикаментов США.
Эта информация была получена непосредственно с веб-сайта clinicaltrials.gov без каких-либо изменений. Если у вас есть запросы на изменение, удаление или обновление сведений об исследовании, обращайтесь по адресу register@clinicaltrials.gov. Как только изменение будет реализовано на clinicaltrials.gov, оно будет автоматически обновлено и на нашем веб-сайте. .