- ICH GCP
- Реестр клинических исследований США
- Клиническое испытание NCT05272189
Пример проекта 3: тестировщик совместной работы человека и ИИ (HAICT) Exp. 7
Обзор исследования
Статус
Вмешательство/лечение
Подробное описание
Этот текст является текстом предварительной регистрации для эксперимента HAICT 7, как описано в Open Science Framework. https://osf.io/hngu4/
ПРИМЕЧАНИЕ. Это исследование является представителем исследований, проведенных в рамках Проекта 3 этого гранта. В пакете экспериментов, представленном Проектом 3, есть несколько экспериментов, но невозможно зарегистрировать пакет исследований на CT.gov.
ПРИМЕЧАНИЕ. Поскольку комментарий к местоимению носит рекомендательный характер, мы пока оставим его.
Тестер совместной работы человека и ИИ (HAICT) Exp. 7 (слегка отредактировано из OSF)
Сбор данных. Были ли уже собраны какие-либо данные для этого исследования? (Да нет)
да
- Гипотеза. Какой главный вопрос задают или проверяют гипотезу в этом исследовании?
Предыстория: В различных поисковых экспериментах, как основных, так и клинических, данные согласовывались с ситуацией, когда изменчивость сигнала (или цели) больше, чем изменчивость шума (дистракторы). Классический признак этого — функция zROC с наклоном < 1 — обычно около 0,6. Наклон 1,0 указывает на задачу 2AFC с равной дисперсией. Для задачи HAICT, которую мы тестировали, мы ожидаем равной дисперсии, но мы думаем, что ее стоит проверить, поэтому мы будем систематически варьировать распространенность, что приведет к смещению критерия. Это вычертит кривую ROC, которую мы сможем изучить.
Мы также проверим искусственный ИИ второго читателя, чтобы определить, ухудшает ли низкая распространенность второго читателя.
- (H1): Мы ожидаем повторить вывод о том, что человеческие критерии становятся более консервативными по мере снижения распространенности.
- (H2): Мы прогнозируем, что наклон результирующего zROC будет равен 1,0.
(H3): Мы предполагаем, что низкая распространенность сделает второй ИИ менее эффективным, поскольку положительная прогностическая ценность его комментариев будет низкой.
Зависимая переменная. Опишите ключевые зависимые переменные, указав, как они будут измеряться.
Основными интересующими зависимыми переменными являются точность (и производные от точности обнаружения сигнала, d' и c), время реакции и субъективные оценки опроса, следующего за каждым блоком.
- Условия. Сколько и на каких условиях будут распределены участники?
В этой серии экспериментов исследуется, как изменение входных данных смоделированного ИИ может повлиять на решения, принимаемые людьми-наблюдателями в двухальтернативной задаче с принудительным выбором (например, решение отозвать женщину для дальнейшего обследования в маммографии). Мы разработали парадигму под названием «Тестер совместной работы человека и ИИ» (HAICT), которая позволяет эффективно тестировать взаимодействия между человеком и смоделированным ИИ.
Задача наблюдателей во всех условиях состоит в том, чтобы дать 2AFC-решение о том, является ли стимул «плохим» или «неплохим». Говоря языком, примерно имитирующим медицинский диагноз, каждый стимул называется «кейсом». Наблюдателей просят принять решение 2AFC о массивах цветных фигур. Решение принимается исходя из преобладающего цвета корпуса. Количество элементов каждого цвета взято из одного из двух нормальных распределений: одного для положительных (плохих) стимулов, а другого для отрицательных (неплохих) стимулов.
Результаты предыдущих экспериментов HAICT (3 и 4) показали, что эффективность человека в состоянии второго читателя значительно снижается при низкой распространенности. Показатели в условиях второго чтения были лучше, чем в исходном состоянии, когда распространенность тяжелых случаев составляла 50%, но были значительно хуже, чем в исходном состоянии, когда распространенность составляла всего 10%. В этом эксперименте мы манипулируем распространенностью «плохих» случаев в условиях второго чтения и базовых условиях. Будут проверены четыре различных показателя распространенности — 10%, 33%, 67% и 90%. Наблюдатели заполняют 8 блоков (2 правила ИИ x 4 коэффициента распространенности), а порядок блоков является случайным.
Правила ИИ для тестирования:
- Исходный уровень — без ввода ИИ. Observer самостоятельно классифицирует каждый случай как «плохой» или «неплохой».
Второй читатель - наблюдатель принимает первоначальное решение по каждому делу. ИИ молча классифицирует стимулы, используя консервативный критерий (c = 0,5). Логика консервативного критерия заключается в том, что второй считыватель используется для сокращения ложноположительных ответов, и поэтому он предназначен для того, чтобы подвергать сомнению положительные человеческие ответы, которые могут быть маргинальными. Если наблюдатель и ИИ расходятся во мнениях, то ИИ информирует наблюдателя-человека. Затем наблюдателю предоставляется возможность либо изменить свой ответ, либо остаться при своем первом мнении.
Как и в экспериментах 1-5, AI d-prime фиксируется на уровне 2,2. Известно, что обратная связь увеличивает эффект распространенности, поэтому обратная связь будет дана как на практике, так и в тестовых испытаниях. Наблюдатели выполнят 20 тренировочных и 200 тестовых заданий в каждом блоке. Сразу после завершения каждого блока наблюдателям будет показана сводка их производительности. После того, как второй читатель заблокируется, ему также будет предложено ответить на три субъективных вопроса о полезности ИИ (подробнее см. «Файлы»).
Анализы. Уточните, какой именно анализ вы проведете для изучения основного вопроса/гипотезы.
Во-первых, мы суммируем количество попаданий, истинных отрицательных результатов, промахов и ложных тревог в каждом блоке. Исходя из этого, мы можем рассчитать точность, положительную прогностическую ценность, чувствительность (d-простое число) и критерий для каждого наблюдателя в каждом из различных условий. Учитывая показатели производительности на 4 уровнях распространенности, мы можем оценить кривую ROC (pHit x pFA) и функцию zROC (zHit x zFA). Мы проверим гипотезу о том, что наклон zROC равен 1 (следствие равнодисперсионной задачи 2AFC).
Больше анализов. Какие-то вторичные анализы?
Мы посмотрим, коррелируют ли субъективные мнения наблюдателей об ИИ с такими переменными, как эмпирическое d-простое число или положительная прогностическая ценность.
Размер образца. Сколько наблюдений будет собрано или что будет определять размер выборки? Не нужно обосновывать решение, но будьте точны в отношении того, как именно будет определяться число.
Мы будем тестировать 12 наблюдателей. Это согласуется с размерами выборки в предыдущих экспериментах.
- Другой. Есть ли что-то еще, что вы хотели бы предварительно зарегистрировать? (например, исключение данных, переменные, собранные для исследовательских целей, запланированные необычные анализы?)
Н/Д
Тип исследования
Регистрация (Действительный)
Фаза
- Непригодный
Контакты и местонахождение
Места учебы
-
-
Massachusetts
-
Boston, Massachusetts, Соединенные Штаты, 02215
- Visual Attention Lab / Brigham and Women's Hospital
-
-
Критерии участия
Критерии приемлемости
Возраст, подходящий для обучения
Принимает здоровых добровольцев
Описание
Критерии включения:
- - Приглашаем всех зарегистрироваться онлайн
Критерий исключения:
- Должен пройти скрининговый тест на цветовое зрение Исихара.
- Зрение 20/25 (с коррекцией)
Учебный план
Как устроено исследование?
Детали дизайна
- Основная цель: Фундаментальная наука
- Распределение: Н/Д
- Интервенционная модель: Одногрупповое задание
- Маскировка: Нет (открытая этикетка)
Оружие и интервенции
Группа участников / Армия |
Вмешательство/лечение |
|---|---|
|
Экспериментальный: Эксперимент
Все участники тестируются во всех условиях этого эксперимента.
|
В этом эксперименте в некоторых условиях участник принимает решение при наличии информации о смоделированном решении искусственного интеллекта.
Частота представления целей варьируется от 10% до 90%.
Другие имена:
|
Что измеряет исследование?
Первичные показатели результатов
Мера результата |
Мера Описание |
Временное ограничение |
|---|---|---|
|
D'
Временное ограничение: Данные собираются в течение сессии продолжительностью около часа.
|
D' (d-prime) — это мера теории обнаружения сигналов, определяющая уровень выполнения задачи.
Она вычисляется путём расчёта доли истинно положительных ответов = (истинно положительные испытания) / (истинно положительные + ложно отрицательные испытания) = p(TP), а также путём расчёта доли ложных положительных ответов = (ложные положительные испытания) / (ложные положительные + истинно отрицательные испытания) = p(FP).
Эти значения преобразуются в 'z-оценки' (например, с использованием функции NORMSINV в Excel для вычисления обратного значения стандартного нормального распределения).
D' определяется как Z(TP) - Z(FP).
Его диапазон составляет от 0 (когда сигнал невозможно отличить от шума) до ~4,0.
Верхний предел не определён, но значение 4 означало бы, что наблюдатель практически идеально различает сигнал и шум.
|
Данные собираются в течение сессии продолжительностью около часа.
|
|
Критерий
Временное ограничение: Данные собираются в течение сессии продолжительностью около часа.
|
Критерий, как D' (см. выше), рассчитывается из z(TP) и z(FP).
Критерий (c) = (z(TP)+z(FP))/-2.
Значение ноль означает, что наблюдатель с одинаковой вероятностью даст положительный (например, 'цель присутствует') или отрицательный (отсутствует) ответ.
Положительные значения означают, что наблюдатель скорее скажет "отсутствует" ("консервативный" критерий).
Отрицательные значения означают, что наблюдатель скорее скажет "присутствует" ("либеральный" критерий).
В данном случае термины "либеральный" и "консервативный" не имеют политической коннотации.
Значения критерия почти всегда находятся в диапазоне от -2 до 2.
|
Данные собираются в течение сессии продолжительностью около часа.
|
Вторичные показатели результатов
Мера результата |
Мера Описание |
Временное ограничение |
|---|---|---|
|
Время реакции
Временное ограничение: Данные собираются в течение сессии продолжительностью около часа.
|
Это мера того, сколько времени требуется для получения ответа.
|
Данные собираются в течение сессии продолжительностью около часа.
|
Соавторы и исследователи
Спонсор
Соавторы
Следователи
- Главный следователь: Jeremy M Wolfe, PhD, Brigham and Women's Hospital
Даты записи исследования
Изучение основных дат
Начало исследования (Действительный)
Первичное завершение (Действительный)
Завершение исследования (Действительный)
Даты регистрации исследования
Первый отправленный
Впервые представлено, что соответствует критериям контроля качества
Первый опубликованный (Действительный)
Обновления учебных записей
Последнее опубликованное обновление (Действительный)
Последнее отправленное обновление, отвечающее критериям контроля качества
Последняя проверка
Дополнительная информация
Термины, связанные с этим исследованием
Ключевые слова
Дополнительные соответствующие термины MeSH
Другие идентификационные номера исследования
- 2007P000646-B
- R01CA207490 (Грант/контракт NIH США)
Планирование данных отдельных участников (IPD)
Планируете делиться данными об отдельных участниках (IPD)?
Описание плана IPD
Сроки обмена IPD
Критерии совместного доступа к IPD
Совместное использование IPD Поддерживающий тип информации
- STUDY_PROTOCOL
- САП
- МКФ
Информация о лекарствах и устройствах, исследовательские документы
Изучает лекарственный продукт, регулируемый FDA США.
Изучает продукт устройства, регулируемый Управлением по санитарному надзору за качеством пищевых продуктов и медикаментов США.
Эта информация была получена непосредственно с веб-сайта clinicaltrials.gov без каких-либо изменений. Если у вас есть запросы на изменение, удаление или обновление сведений об исследовании, обращайтесь по адресу register@clinicaltrials.gov. Как только изменение будет реализовано на clinicaltrials.gov, оно будет автоматически обновлено и на нашем веб-сайте. .