Эта страница была переведена автоматически, точность перевода не гарантируется. Пожалуйста, обратитесь к английской версии для исходного текста.

Пример проекта 3: тестировщик совместной работы человека и ИИ (HAICT) Exp. 7

29 декабря 2025 г. обновлено: Jeremy M Wolfe, PhD, Brigham and Women's Hospital
Исследование является частью «связки» экспериментов, составляющих третий проект гранта Национального института глаз. Третий проект включает в себя серию экспериментов, в которых исследуется, как изменение входных данных смоделированного ИИ может повлиять на решения, принимаемые людьми-наблюдателями в задаче с принудительным выбором с двумя альтернативами (например, решение отозвать женщину для дальнейшего обследования в маммографии). Описанный здесь эксперимент HAICT 7 исследует, как изменение распространенности влияет на производительность человека, когда ИИ используется в качестве второго считывателя.

Обзор исследования

Подробное описание

Этот текст является текстом предварительной регистрации для эксперимента HAICT 7, как описано в Open Science Framework. https://osf.io/hngu4/

ПРИМЕЧАНИЕ. Это исследование является представителем исследований, проведенных в рамках Проекта 3 этого гранта. В пакете экспериментов, представленном Проектом 3, есть несколько экспериментов, но невозможно зарегистрировать пакет исследований на CT.gov.

ПРИМЕЧАНИЕ. Поскольку комментарий к местоимению носит рекомендательный характер, мы пока оставим его.

Тестер совместной работы человека и ИИ (HAICT) Exp. 7 (слегка отредактировано из OSF)

  1. Сбор данных. Были ли уже собраны какие-либо данные для этого исследования? (Да нет)

    да

  2. Гипотеза. Какой главный вопрос задают или проверяют гипотезу в этом исследовании?

Предыстория: В различных поисковых экспериментах, как основных, так и клинических, данные согласовывались с ситуацией, когда изменчивость сигнала (или цели) больше, чем изменчивость шума (дистракторы). Классический признак этого — функция zROC с наклоном < 1 — обычно около 0,6. Наклон 1,0 указывает на задачу 2AFC с равной дисперсией. Для задачи HAICT, которую мы тестировали, мы ожидаем равной дисперсии, но мы думаем, что ее стоит проверить, поэтому мы будем систематически варьировать распространенность, что приведет к смещению критерия. Это вычертит кривую ROC, которую мы сможем изучить.

Мы также проверим искусственный ИИ второго читателя, чтобы определить, ухудшает ли низкая распространенность второго читателя.

  • (H1): Мы ожидаем повторить вывод о том, что человеческие критерии становятся более консервативными по мере снижения распространенности.
  • (H2): Мы прогнозируем, что наклон результирующего zROC будет равен 1,0.
  • (H3): Мы предполагаем, что низкая распространенность сделает второй ИИ менее эффективным, поскольку положительная прогностическая ценность его комментариев будет низкой.

    1. Зависимая переменная. Опишите ключевые зависимые переменные, указав, как они будут измеряться.

      Основными интересующими зависимыми переменными являются точность (и производные от точности обнаружения сигнала, d' и c), время реакции и субъективные оценки опроса, следующего за каждым блоком.

    2. Условия. Сколько и на каких условиях будут распределены участники?

В этой серии экспериментов исследуется, как изменение входных данных смоделированного ИИ может повлиять на решения, принимаемые людьми-наблюдателями в двухальтернативной задаче с принудительным выбором (например, решение отозвать женщину для дальнейшего обследования в маммографии). Мы разработали парадигму под названием «Тестер совместной работы человека и ИИ» (HAICT), которая позволяет эффективно тестировать взаимодействия между человеком и смоделированным ИИ.

Задача наблюдателей во всех условиях состоит в том, чтобы дать 2AFC-решение о том, является ли стимул «плохим» или «неплохим». Говоря языком, примерно имитирующим медицинский диагноз, каждый стимул называется «кейсом». Наблюдателей просят принять решение 2AFC о массивах цветных фигур. Решение принимается исходя из преобладающего цвета корпуса. Количество элементов каждого цвета взято из одного из двух нормальных распределений: одного для положительных (плохих) стимулов, а другого для отрицательных (неплохих) стимулов.

Результаты предыдущих экспериментов HAICT (3 и 4) показали, что эффективность человека в состоянии второго читателя значительно снижается при низкой распространенности. Показатели в условиях второго чтения были лучше, чем в исходном состоянии, когда распространенность тяжелых случаев составляла 50%, но были значительно хуже, чем в исходном состоянии, когда распространенность составляла всего 10%. В этом эксперименте мы манипулируем распространенностью «плохих» случаев в условиях второго чтения и базовых условиях. Будут проверены четыре различных показателя распространенности — 10%, 33%, 67% и 90%. Наблюдатели заполняют 8 блоков (2 правила ИИ x 4 коэффициента распространенности), а порядок блоков является случайным.

Правила ИИ для тестирования:

  1. Исходный уровень — без ввода ИИ. Observer самостоятельно классифицирует каждый случай как «плохой» или «неплохой».
  2. Второй читатель - наблюдатель принимает первоначальное решение по каждому делу. ИИ молча классифицирует стимулы, используя консервативный критерий (c = 0,5). Логика консервативного критерия заключается в том, что второй считыватель используется для сокращения ложноположительных ответов, и поэтому он предназначен для того, чтобы подвергать сомнению положительные человеческие ответы, которые могут быть маргинальными. Если наблюдатель и ИИ расходятся во мнениях, то ИИ информирует наблюдателя-человека. Затем наблюдателю предоставляется возможность либо изменить свой ответ, либо остаться при своем первом мнении.

    Как и в экспериментах 1-5, AI d-prime фиксируется на уровне 2,2. Известно, что обратная связь увеличивает эффект распространенности, поэтому обратная связь будет дана как на практике, так и в тестовых испытаниях. Наблюдатели выполнят 20 тренировочных и 200 тестовых заданий в каждом блоке. Сразу после завершения каждого блока наблюдателям будет показана сводка их производительности. После того, как второй читатель заблокируется, ему также будет предложено ответить на три субъективных вопроса о полезности ИИ (подробнее см. «Файлы»).

  3. Анализы. Уточните, какой именно анализ вы проведете для изучения основного вопроса/гипотезы.

    Во-первых, мы суммируем количество попаданий, истинных отрицательных результатов, промахов и ложных тревог в каждом блоке. Исходя из этого, мы можем рассчитать точность, положительную прогностическую ценность, чувствительность (d-простое число) и критерий для каждого наблюдателя в каждом из различных условий. Учитывая показатели производительности на 4 уровнях распространенности, мы можем оценить кривую ROC (pHit x pFA) и функцию zROC (zHit x zFA). Мы проверим гипотезу о том, что наклон zROC равен 1 (следствие равнодисперсионной задачи 2AFC).

  4. Больше анализов. Какие-то вторичные анализы?

    Мы посмотрим, коррелируют ли субъективные мнения наблюдателей об ИИ с такими переменными, как эмпирическое d-простое число или положительная прогностическая ценность.

  5. Размер образца. Сколько наблюдений будет собрано или что будет определять размер выборки? Не нужно обосновывать решение, но будьте точны в отношении того, как именно будет определяться число.

    Мы будем тестировать 12 наблюдателей. Это согласуется с размерами выборки в предыдущих экспериментах.

  6. Другой. Есть ли что-то еще, что вы хотели бы предварительно зарегистрировать? (например, исключение данных, переменные, собранные для исследовательских целей, запланированные необычные анализы?)

Н/Д

Тип исследования

Интервенционный

Регистрация (Действительный)

12

Фаза

  • Непригодный

Контакты и местонахождение

В этом разделе приведены контактные данные лиц, проводящих исследование, и информация о том, где проводится это исследование.

Места учебы

    • Massachusetts
      • Boston, Massachusetts, Соединенные Штаты, 02215
        • Visual Attention Lab / Brigham and Women's Hospital

Критерии участия

Исследователи ищут людей, которые соответствуют определенному описанию, называемому критериям приемлемости. Некоторыми примерами этих критериев являются общее состояние здоровья человека или предшествующее лечение.

Критерии приемлемости

Возраст, подходящий для обучения

18 лет и старше (Взрослый, Пожилой взрослый)

Принимает здоровых добровольцев

Да

Описание

Критерии включения:

  • - Приглашаем всех зарегистрироваться онлайн

Критерий исключения:

  • Должен пройти скрининговый тест на цветовое зрение Исихара.
  • Зрение 20/25 (с коррекцией)

Учебный план

В этом разделе представлена ​​подробная информация о плане исследования, в том числе о том, как планируется исследование и что оно измеряет.

Как устроено исследование?

Детали дизайна

  • Основная цель: Фундаментальная наука
  • Распределение: Н/Д
  • Интервенционная модель: Одногрупповое задание
  • Маскировка: Нет (открытая этикетка)

Оружие и интервенции

Группа участников / Армия
Вмешательство/лечение
Экспериментальный: Эксперимент
Все участники тестируются во всех условиях этого эксперимента.
В этом эксперименте в некоторых условиях участник принимает решение при наличии информации о смоделированном решении искусственного интеллекта.
Частота представления целей варьируется от 10% до 90%.
Другие имена:
  • Базовая ставка

Что измеряет исследование?

Первичные показатели результатов

Мера результата
Мера Описание
Временное ограничение
D'
Временное ограничение: Данные собираются в течение сессии продолжительностью около часа.
D' (d-prime) — это мера теории обнаружения сигналов, определяющая уровень выполнения задачи. Она вычисляется путём расчёта доли истинно положительных ответов = (истинно положительные испытания) / (истинно положительные + ложно отрицательные испытания) = p(TP), а также путём расчёта доли ложных положительных ответов = (ложные положительные испытания) / (ложные положительные + истинно отрицательные испытания) = p(FP). Эти значения преобразуются в 'z-оценки' (например, с использованием функции NORMSINV в Excel для вычисления обратного значения стандартного нормального распределения). D' определяется как Z(TP) - Z(FP). Его диапазон составляет от 0 (когда сигнал невозможно отличить от шума) до ~4,0. Верхний предел не определён, но значение 4 означало бы, что наблюдатель практически идеально различает сигнал и шум.
Данные собираются в течение сессии продолжительностью около часа.
Критерий
Временное ограничение: Данные собираются в течение сессии продолжительностью около часа.
Критерий, как D' (см. выше), рассчитывается из z(TP) и z(FP). Критерий (c) = (z(TP)+z(FP))/-2. Значение ноль означает, что наблюдатель с одинаковой вероятностью даст положительный (например, 'цель присутствует') или отрицательный (отсутствует) ответ. Положительные значения означают, что наблюдатель скорее скажет "отсутствует" ("консервативный" критерий). Отрицательные значения означают, что наблюдатель скорее скажет "присутствует" ("либеральный" критерий). В данном случае термины "либеральный" и "консервативный" не имеют политической коннотации. Значения критерия почти всегда находятся в диапазоне от -2 до 2.
Данные собираются в течение сессии продолжительностью около часа.

Вторичные показатели результатов

Мера результата
Мера Описание
Временное ограничение
Время реакции
Временное ограничение: Данные собираются в течение сессии продолжительностью около часа.
Это мера того, сколько времени требуется для получения ответа.
Данные собираются в течение сессии продолжительностью около часа.

Соавторы и исследователи

Здесь вы найдете людей и организации, участвующие в этом исследовании.

Следователи

  • Главный следователь: Jeremy M Wolfe, PhD, Brigham and Women's Hospital

Даты записи исследования

Эти даты отслеживают ход отправки отчетов об исследованиях и сводных результатов на сайт ClinicalTrials.gov. Записи исследований и сообщаемые результаты проверяются Национальной медицинской библиотекой (NLM), чтобы убедиться, что они соответствуют определенным стандартам контроля качества, прежде чем публиковать их на общедоступном веб-сайте.

Изучение основных дат

Начало исследования (Действительный)

1 января 2020 г.

Первичное завершение (Действительный)

1 августа 2024 г.

Завершение исследования (Действительный)

4 ноября 2025 г.

Даты регистрации исследования

Первый отправленный

18 февраля 2022 г.

Впервые представлено, что соответствует критериям контроля качества

28 февраля 2022 г.

Первый опубликованный (Действительный)

9 марта 2022 г.

Обновления учебных записей

Последнее опубликованное обновление (Действительный)

20 января 2026 г.

Последнее отправленное обновление, отвечающее критериям контроля качества

29 декабря 2025 г.

Последняя проверка

1 декабря 2025 г.

Дополнительная информация

Термины, связанные с этим исследованием

Дополнительные соответствующие термины MeSH

Другие идентификационные номера исследования

  • 2007P000646-B
  • R01CA207490 (Грант/контракт NIH США)

Планирование данных отдельных участников (IPD)

Планируете делиться данными об отдельных участниках (IPD)?

ДА

Описание плана IPD

Неидентифицированные необработанные данные будут размещены на странице OSF эксперимента, а также будут доступны по запросу PI.

Сроки обмена IPD

Материалы будут доступны по запросу

Критерии совместного доступа к IPD

по существу неограниченный

Совместное использование IPD Поддерживающий тип информации

  • STUDY_PROTOCOL
  • САП
  • МКФ

Информация о лекарствах и устройствах, исследовательские документы

Изучает лекарственный продукт, регулируемый FDA США.

Нет

Изучает продукт устройства, регулируемый Управлением по санитарному надзору за качеством пищевых продуктов и медикаментов США.

Нет

Эта информация была получена непосредственно с веб-сайта clinicaltrials.gov без каких-либо изменений. Если у вас есть запросы на изменение, удаление или обновление сведений об исследовании, обращайтесь по адресу register@clinicaltrials.gov. Как только изменение будет реализовано на clinicaltrials.gov, оно будет автоматически обновлено и на нашем веб-сайте. .

Подписаться