Эта страница была переведена автоматически, точность перевода не гарантируется. Пожалуйста, обратитесь к английской версии для исходного текста.

Диагностические рассуждения с индивидуальной моделью GPT-4

27 марта 2025 г. обновлено: Jonathan Chen, Stanford University

Оценка эффективности LLM и клиницистов в сложных диагностических случаях: рандомизированное контролируемое исследование

Это исследование оценит влияние немедленного доступа к индивидуальной версии GPT-4, большой языковой модели, на производительность в задачах диагностических рассуждений на основе случая. В частности, он сравнит этот подход с двухэтапным процессом, когда участники сначала используют традиционные инструменты поддержки диагностических решений для поддержки своих диагностических рассуждений, прежде чем получить доступ к индивидуальной модели GPT-4.

Обзор исследования

Подробное описание

Технологии искусственного интеллекта (ИИ), особенно передовые крупные языковые модели, такие как CHATGPT Openai, могут улучшить медицинское принятие решений. В то время как CHATGPT-4 не был специально разработан для медицинских приложений, он продемонстрировал перспективу в различных контекстах здравоохранения, включая медицинскую запись о записке, обращение к вопросам пациентов и содействие медицинским консультациям. Тем не менее, его влияние на диагностические рассуждения клиницистов остается в значительной степени неизвестным.

Клинические рассуждения - это сложный процесс, который включает распознавание закономерности, применение знаний и вероятностные рассуждения. Интеграция инструментов ИИ, таких как CHATGPT-4 в рабочие процессы врачей, может помочь уменьшить рабочую нагрузку врача и снизить вероятность пропущенных диагнозов. Тем не менее, CHATGPT-4 не был не разработан и не был подтвержден для диагностических рассуждений, и он может дать вводящую в заблуждение информацию, включая правдоподобные, но неверные выводы, которые могут ошибаться клиницистов. Если не использовать надлежащим образом, это может не улучшить и может даже препятствовать принятию решений. Поэтому важно изучить, как клиницисты используют большие языковые модели для поддержки клинических рассуждений, прежде чем интегрировать их в обычный уход за пациентами.

В этом исследовании будет рассмотрено, как немедленный доступ к индивидуальной версии CHATGPT-4 влияет на производительность на основанные на случаях задачи диагностических рассуждений, по сравнению с поэтапным подходом. В поэтапном подходе участники сначала будут использовать традиционные инструменты поддержки диагностических решений для поддержки их артерии, прежде чем взаимодействовать с индивидуальной моделью CHATGPT-4, после чего у них будет возможность пересмотреть свои первоначальные ответы.

Участники будут рандомизированы в различные вооружения исследования и будут реагировать на диагностические случаи, предоставив три дифференциальных диагноза, а также вспомогательные и противоположные результаты для каждого. Они также выявят свой лучший диагноз и предложат следующие диагностические шаги. Независимые рецензенты, слепые до назначения лечения, будут оценивать их ответы.

Тип исследования

Интервенционный

Регистрация (Действительный)

70

Фаза

  • Непригодный

Контакты и местонахождение

В этом разделе приведены контактные данные лиц, проводящих исследование, и информация о том, где проводится это исследование.

Места учебы

Критерии участия

Исследователи ищут людей, которые соответствуют определенному описанию, называемому критериям приемлемости. Некоторыми примерами этих критериев являются общее состояние здоровья человека или предшествующее лечение.

Критерии приемлемости

Возраст, подходящий для обучения

  • Ребенок
  • Взрослый
  • Пожилой взрослый

Принимает здоровых добровольцев

Да

Описание

Критерии включения:

  • Участники должны быть лицензированными врачами и пройти как минимум аспирантуру 1 (PGY1) медицинской подготовки.
  • Обучение по внутренней медицине, семейной медицине или неотложной медицине.

Критерии исключения:

  • В настоящее время не практикует клинически.
  • Участвовал в одном из наших предыдущих исследований, в котором использовались те же шесть диагностических случаев.

Учебный план

В этом разделе представлена ​​подробная информация о плане исследования, в том числе о том, как планируется исследование и что оно измеряет.

Как устроено исследование?

Детали дизайна

  • Основная цель: Диагностика
  • Распределение: Рандомизированный
  • Интервенционная модель: Параллельное назначение
  • Маскировка: Одинокий

Оружие и интервенции

Группа участников / Армия
Вмешательство/лечение
Активный компаратор: Немедленный доступ к индивидуальной версии GPT-4
Группе будет рекомендовано немедленно использовать индивидуальную версию GPT-4.
Группе предоставляется немедленный доступ к индивидуальной версии GPT-4 для поддержки их диагностических рассуждений для каждого случая.
Активный компаратор: Сначала традиционные ресурсы, а затем предоставили доступ к индивидуальной версии GPT-4.
Группе будет рекомендовано сначала использовать любые ресурсы, которые они хотят, кроме крупных языковых моделей (Uptodate, PubMed, Google и т. Д.), А затем будет предоставлен доступ к индивидуальной версии GPT-4.
Группа сначала рекомендуется рассуждать через диагностические случаи при поддержке традиционных ресурсов. После того, как они отправляют ответы на случай, им затем дают доступ к индивидуальной версии GPT-4 и имеют возможность изменить свои первоначальные ответы.

Что измеряет исследование?

Первичные показатели результатов

Мера результата
Мера Описание
Временное ограничение
Диагностические рассуждения
Временное ограничение: Благодаря завершению исследования в среднем 6 месяцев
Основным результатом будет процент правильных ответов на случай (диапазон: от 0 до 100). Для каждого случая участников будет предложено предоставить свои три лучших дифференциальных диагноза, а также вспомогательные и противоположные результаты для каждого. Они получат 1 балл за каждый правдоподобный диагноз. Поддержка и противоположные результаты будут оценены на основе правильности, с 1 точкой для частично правильного ответа и 2 балла для совершенно правильного ответа. Затем участники выберут свой лучший диагноз, заработав 1 балл за разумный выбор и 2 балла для наиболее точного диагноза. Наконец, они перечисляют до трех следующих шагов для дальнейшей оценки пациента, причем 1 балл присужден за частично правильный ответ и 2 балла за совершенно правильный ответ. Первичный результат будет проанализирован на уровне случая, что сравнивает производительность между рандомизированными группами исследования.
Благодаря завершению исследования в среднем 6 месяцев

Вторичные показатели результатов

Мера результата
Мера Описание
Временное ограничение
Время, проведенное на случай
Временное ограничение: Благодаря завершению исследования в среднем 6 месяцев
Следователи будут сравнивать среднее время (в минуты), которые участники тратят на каждый случай в двух учебных руках.
Благодаря завершению исследования в среднем 6 месяцев
Быстрое частота
Временное ограничение: Благодаря завершению исследования в среднем 6 месяцев
Исследователи будут сравнивать частоту подсказок участников с индивидуальной моделью GPT-4 между двумя исследовательскими группами.
Благодаря завершению исследования в среднем 6 месяцев
Настроение
Временное ограничение: Благодаря завершению исследования в среднем 6 месяцев
Исследователи будут сравнивать тон и настроение подсказок участников с индивидуальной моделью GPT-4 в двух исследовательских группах. Следователи создадут качественную систему кодирования для классификации характера подсказок участников.
Благодаря завершению исследования в среднем 6 месяцев
Восприятие участников ИИ в клинических рассуждениях
Временное ограничение: Благодаря завершению исследования в среднем 6 месяцев
Этот результат будет оцениваться в обоих руках исследования и будет охватывать изменения в отношении, уверенности и готовности использовать инструменты диагностики искусственного интеллекта до и после воздействия на индивидуальный инструмент. Мы оценим количество участников, которые были открыты для использования ИИ, чтобы помочь со сложными клиническими рассуждениями (до- и пост-Quiz), если им понравилось работать с диагностическим инструментом ИИ, если они казались, что инструмент обеспечил ценный совместный опыт для клинических рассуждений, если просмотр рекомендаций по диагностике AI повысит их повседневную работу в их повседневной работе в их повседневной работе в Distrostic, которые будут использовать их в повседневной работе в Distrostic, которые будут использовать их в повседневной работе. Они будут оцениваться в рейтинге Лайкерта, от категорически не согласны до полного согласия.
Благодаря завершению исследования в среднем 6 месяцев
Индивидуальные диагностические рассуждения GPT-4
Временное ограничение: Благодаря завершению исследования в среднем 6 месяцев
Индивидуальные «независимые» диагнозы GPT-4 будут оцениваться для точности. Результатом будет процент правильных ответов на случай (диапазон: от 0 до 100). Для каждого случая мета-продукт направляет индивидуальный GPT-4 для обеспечения трех лучших дифференциальных диагнозов, а также поддержки и противоположных результатов для каждого, окончательный диагноз и следующие этапы. Индивидуальный GPT-4 получит 1 балл за каждый правдоподобный диагноз. Поддержка и противоположные результаты будут оценены на основе правильности, с 1 точкой для частично правильного ответа и 2 балла для совершенно правильного ответа. Его лучший диагноз получит 1 балл за разумный выбор и 2 балла за наиболее точный диагноз. Наконец, в нем будет указано до трех следующих шагов для дальнейшей оценки пациента, причем 1 балл присужден за частично правильный ответ и 2 балла за совершенно правильный ответ. Результат будет проанализирован на уровне случая, сравнивая производительность с оценками рандомизированных исследовательских групп.
Благодаря завершению исследования в среднем 6 месяцев

Соавторы и исследователи

Здесь вы найдете людей и организации, участвующие в этом исследовании.

Спонсор

Следователи

  • Главный следователь: Jonathan H Chen, MD, PhD, Stanford University

Даты записи исследования

Эти даты отслеживают ход отправки отчетов об исследованиях и сводных результатов на сайт ClinicalTrials.gov. Записи исследований и сообщаемые результаты проверяются Национальной медицинской библиотекой (NLM), чтобы убедиться, что они соответствуют определенным стандартам контроля качества, прежде чем публиковать их на общедоступном веб-сайте.

Изучение основных дат

Начало исследования (Действительный)

16 декабря 2024 г.

Первичное завершение (Действительный)

24 января 2025 г.

Завершение исследования (Действительный)

24 января 2025 г.

Даты регистрации исследования

Первый отправленный

11 февраля 2025 г.

Впервые представлено, что соответствует критериям контроля качества

27 марта 2025 г.

Первый опубликованный (Действительный)

4 апреля 2025 г.

Обновления учебных записей

Последнее опубликованное обновление (Действительный)

4 апреля 2025 г.

Последнее отправленное обновление, отвечающее критериям контроля качества

27 марта 2025 г.

Последняя проверка

1 марта 2025 г.

Дополнительная информация

Термины, связанные с этим исследованием

Дополнительные соответствующие термины MeSH

Другие идентификационные номера исследования

  • 71319c

Планирование данных отдельных участников (IPD)

Планируете делиться данными об отдельных участниках (IPD)?

НЕТ

Информация о лекарствах и устройствах, исследовательские документы

Изучает лекарственный продукт, регулируемый FDA США.

Нет

Изучает продукт устройства, регулируемый Управлением по санитарному надзору за качеством пищевых продуктов и медикаментов США.

Нет

продукт, произведенный в США и экспортированный из США.

Нет

Эта информация была получена непосредственно с веб-сайта clinicaltrials.gov без каких-либо изменений. Если у вас есть запросы на изменение, удаление или обновление сведений об исследовании, обращайтесь по адресу register@clinicaltrials.gov. Как только изменение будет реализовано на clinicaltrials.gov, оно будет автоматически обновлено и на нашем веб-сайте. .

Подписаться