Ta strona została przetłumaczona automatycznie i dokładność tłumaczenia nie jest gwarantowana. Proszę odnieść się do angielska wersja za tekst źródłowy.

Rozumowanie diagnostyczne z dostosowanym modelem GPT-4

27 marca 2025 zaktualizowane przez: Jonathan Chen, Stanford University

Ocena wydajności LLM i klinicystów w złożonych przypadkach diagnostycznych: randomizowane badanie kontrolowane

To badanie oceni wpływ natychmiastowego dostępu do dostosowanej wersji GPT-4, dużego modelu językowego, na wydajność w zadaniach rozumowania diagnostycznego opartego na przypadkach. W szczególności porówna to podejście z dwuetapowym procesem, w którym uczestnicy najpierw używają tradycyjnych narzędzi wspomagania decyzji diagnostycznych, aby wspierać ich rozumowanie diagnostyczne przed uzyskaniem dostępu do dostosowanego modelu GPT-4.

Przegląd badań

Szczegółowy opis

Technologie sztucznej inteligencji (AI), szczególnie zaawansowane duże modele językowe, takie jak ChatGPT Openai, mogą poprawić podejmowanie decyzji medycznych. Chociaż CHATGPT-4 nie był specjalnie zaprojektowany do zastosowań medycznych, wykazał się obietnicą w różnych kontekstach opieki zdrowotnej, w tym w pisaniu notatek medycznych, zwracaniu się do zapytań pacjentów i ułatwianiu konsultacji medycznych. Jednak jego wpływ na uzasadnienie diagnostyczne klinicystów pozostaje w dużej mierze nieznane.

Rozumowanie kliniczne jest złożonym procesem, który obejmuje rozpoznawanie wzorców, zastosowanie wiedzy i probabilistyczne rozumowanie. Integracja narzędzi AI, takich jak CHATGPT-4 z przepływami pracy lekarzy, może pomóc w zmniejszeniu obciążenia lekarza i zmniejszenia prawdopodobieństwa pominięcia diagnoz. Jednak CHATGPT-4 nie był ani opracowany, ani zatwierdzony w celu uzasadnienia diagnostycznego i może dostarczyć wprowadzających w błąd informacji, w tym prawdopodobnych, ale nieprawidłowych wniosków, które mogą wprowadzać w błąd klinicystów. Jeśli nie jest odpowiednio użyty, może się nie poprawić-i może nawet utrudniać podejmowanie decyzji. Dlatego konieczne jest zbadanie, w jaki sposób klinicyści używają dużych modeli językowych do wspierania rozumowania klinicznego przed zintegrowaniem ich z rutynową opieką nad pacjentem.

To badanie zbada, w jaki sposób natychmiastowy dostęp do dostosowanej wersji Chatgpt-4 wpływa na wydajność na zadania diagnostyczne oparte na przypadkach, w porównaniu z podejściem stopniowym. W podejściu krokowym uczestnicy najpierw użyją tradycyjnych narzędzi do wsparcia decyzji diagnostycznych, aby wspierać rozumowanie sprawy przed interakcją z dostosowanym modelem Chatgpt-4, w którym to momencie będą mieli okazję zrewidować swoje początkowe odpowiedzi.

Uczestnicy będą losowo przydzielani do różnych ramion badawczych i odpowiedzą na przypadki diagnostyczne, dostarczając trzy diagnozy różnicowe, wraz z ustaleniami wspierającymi i przeciwnymi dla każdego z nich. Zidentyfikują również swoją najlepszą diagnozę i zaproponują kolejne kroki diagnostyczne. Niezależni recenzenci, zaślepieni na przydział leczenia, ocenią swoje odpowiedzi.

Typ studiów

Interwencyjne

Zapisy (Rzeczywisty)

70

Faza

  • Nie dotyczy

Kontakty i lokalizacje

Ta sekcja zawiera dane kontaktowe osób prowadzących badanie oraz informacje o tym, gdzie badanie jest przeprowadzane.

Lokalizacje studiów

    • California
      • Palo Alto, California, Stany Zjednoczone, 94305
        • Stanford University

Kryteria uczestnictwa

Badacze szukają osób, które pasują do określonego opisu, zwanego kryteriami kwalifikacyjnymi. Niektóre przykłady tych kryteriów to ogólny stan zdrowia danej osoby lub wcześniejsze leczenie.

Kryteria kwalifikacji

Wiek uprawniający do nauki

  • Dziecko
  • Dorosły
  • Starszy dorosły

Akceptuje zdrowych ochotników

Tak

Opis

Kryteria włączenia:

  • Uczestnicy muszą być licencjonowanymi lekarzami i ukończyć co najmniej podyplomowe rok 1 (PGY1) szkolenia medycznego.
  • Szkolenie w zakresie medycyny wewnętrznej, medycyny rodzinnej lub medycyny ratunkowej.

Kryteria wykluczenia:

  • Nie praktykuje się obecnie klinicznie.
  • Uczestniczył w jednym z naszych wcześniejszych badań, w których zastosowano te same sześć przypadków diagnostycznych.

Plan studiów

Ta sekcja zawiera szczegółowe informacje na temat planu badania, w tym sposób zaprojektowania badania i jego pomiary.

Jak projektuje się badanie?

Szczegóły projektu

  • Główny cel: Diagnostyczny
  • Przydział: Randomizowane
  • Model interwencyjny: Przydział równoległy
  • Maskowanie: Pojedynczy

Broń i interwencje

Grupa uczestników / Arm
Interwencja / Leczenie
Aktywny komparator: Natychmiastowy dostęp do dostosowanej wersji GPT-4
Grupa będzie zachęcana do natychmiastowego użycia dostosowanej wersji GPT-4.
Grupa ma natychmiastowy dostęp do dostosowanej wersji GPT-4 w celu obsługi ich uzasadnienia diagnostycznego dla każdego przypadku.
Aktywny komparator: Zasoby konwencjonalne najpierw, a następnie przyznały dostęp do dostosowanej wersji GPT-4.
Grupa będzie zachęcana do najpierw korzystania z wszelkich zasobów, które chcą oprócz dużych modeli językowych (Uptodate, PubMed, Google itp.), A następnie otrzyma dostęp do dostosowanej wersji GPT-4.
Grupa jest najpierw zachęcana do rozumowania poprzez przypadki diagnostyczne przy wsparciu zasobów konwencjonalnych. Po przesłaniu odpowiedzi sprawy otrzymują dostęp do dostosowanej wersji GPT-4 i mają możliwość zmiany początkowych odpowiedzi.

Co mierzy badanie?

Podstawowe miary wyniku

Miara wyniku
Opis środka
Ramy czasowe
Rozumowanie diagnostyczne
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
Podstawowym rezultatem będzie odsetek poprawnych odpowiedzi na przypadek (zakres: 0 do 100). W każdym przypadku uczestnicy zostaną poproszeni o udzielenie trzech najlepszych diagnoz różnicowych, wraz z ustaleniami wspierającymi i przeciwnymi dla każdego z nich. Otrzymają 1 punkt dla każdej prawdopodobnej diagnozy. Ustalenia wspierające i przeciwne zostaną ocenione na podstawie poprawności, z 1 punktem dla częściowo poprawnej odpowiedzi i 2 punktami dla całkowicie poprawnej odpowiedzi. Następnie uczestnicy wybiorą swoją najlepszą diagnozę, zdobywając 1 punkt dla rozsądnego wyboru i 2 punkty dla najdokładniejszej diagnozy. Wreszcie, wymienili do trzech kolejnych kroków w celu dalszej oceny pacjenta, z 1 punktem przyznanym za częściowo poprawną odpowiedź i 2 punkty za całkowicie poprawną odpowiedź. Podstawowy wynik zostanie przeanalizowany na poziomie przypadku, porównując wydajność między randomizowanymi grupami badawczymi.
Poprzez zakończenie badania średnio 6 miesięcy

Miary wyników drugorzędnych

Miara wyniku
Opis środka
Ramy czasowe
Czas spędzony na sprawę
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
Śledczy porównają średni czas (w ciągu kilku minut) uczestnicy wydają na każdą sprawę na dwóch ramionach badań.
Poprzez zakończenie badania średnio 6 miesięcy
Szybka częstotliwość
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
Śledczy porównują częstotliwość podpowiedzi uczestnika z dostosowanym modelem GPT-4 między dwiema grupami badawczymi.
Poprzez zakończenie badania średnio 6 miesięcy
Sentyment
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
Śledczy porównają ton i sentyment podpowiedzi uczestnika z dostosowanym modelem GPT-4 w dwóch grupach badawczych. Śledczy utworzą jakościowy system kodowania, aby skategoryzować charakter podpowiedzi uczestników.
Poprzez zakończenie badania średnio 6 miesięcy
Postrzeganie przez uczestników sztucznej inteligencji w rozumowaniu klinicznym
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
Wynik ten zostanie oceniony w obu ramionach badań i obejmowałby zmiany postaw, pewności siebie i gotowości do korzystania z narzędzi diagnostycznych AI przed i po wystawieniu na narzędzie spersonalizowanego. Ocenimy liczbę uczestników, którzy byli otwarci na korzystanie z AI w celu pomocy w złożonym rozumowaniu klinicznym (przed- i po Quizie), jeśli lubili pracę z narzędziem diagnostycznym AI, jeśli czują, że narzędzie zapewniło cenne doświadczenie współpracy do rozumowania klinicznego, jeśli zobaczenie zaleceń diagnostycznych AI zwiększyło ich zaufanie do ich różnicowych diagnozów, a jeśli wykorzystają to narzędzie diagnostyczne AI takie jak to w tym badaniu w tym miejscu pracy. Zostaną one ocenione w rankingu skali Likerta od silnego nie zgadzania się na zdecydowanie się zgodzić.
Poprzez zakończenie badania średnio 6 miesięcy
Dostosowane rozumowanie diagnostyczne GPT-4
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
Dostosowane „niezależne” diagnozy GPT-4 zostaną ocenione pod kątem dokładności. Rezultatem będzie odsetek poprawnych odpowiedzi na przypadek (zakres: 0 do 100). W każdym przypadku meta-Prompt kieruje dostosowanym GPT-4, aby zapewnić trzy najważniejsze diagnozy różnicowe, wraz z ustaleniami wspierającymi i przeciwnymi dla każdej, ostatecznej diagnozy i kolejnych kroków. Dostosowany GPT-4 otrzyma 1 punkt dla każdej prawdopodobnej diagnozy. Ustalenia wspierające i przeciwne zostaną ocenione na podstawie poprawności, z 1 punktem dla częściowo poprawnej odpowiedzi i 2 punktami dla całkowicie poprawnej odpowiedzi. Jego najwyższa diagnoza przyniesie 1 punkt dla rozsądnego wyboru i 2 punkty dla najdokładniejszej diagnozy. Wreszcie, wymieniono do trzech kolejnych kroków w celu dalszej oceny pacjenta, z 1 punktem przyznanym za częściowo poprawną odpowiedź i 2 punkty za całkowicie poprawną odpowiedź. Wynik zostanie przeanalizowany na poziomie przypadku, w porównaniu z wynikami randomizowanymi grupami badań.
Poprzez zakończenie badania średnio 6 miesięcy

Współpracownicy i badacze

Tutaj znajdziesz osoby i organizacje zaangażowane w to badanie.

Śledczy

  • Główny śledczy: Jonathan H Chen, MD, PhD, Stanford University

Daty zapisu na studia

Daty te śledzą postęp w przesyłaniu rekordów badań i podsumowań wyników do ClinicalTrials.gov. Zapisy badań i zgłoszone wyniki są przeglądane przez National Library of Medicine (NLM), aby upewnić się, że spełniają określone standardy kontroli jakości, zanim zostaną opublikowane na publicznej stronie internetowej.

Główne daty studiów

Rozpoczęcie studiów (Rzeczywisty)

16 grudnia 2024

Zakończenie podstawowe (Rzeczywisty)

24 stycznia 2025

Ukończenie studiów (Rzeczywisty)

24 stycznia 2025

Daty rejestracji na studia

Pierwszy przesłany

11 lutego 2025

Pierwszy przesłany, który spełnia kryteria kontroli jakości

27 marca 2025

Pierwszy wysłany (Rzeczywisty)

4 kwietnia 2025

Aktualizacje rekordów badań

Ostatnia wysłana aktualizacja (Rzeczywisty)

4 kwietnia 2025

Ostatnia przesłana aktualizacja, która spełniała kryteria kontroli jakości

27 marca 2025

Ostatnia weryfikacja

1 marca 2025

Więcej informacji

Terminy związane z tym badaniem

Dodatkowe istotne warunki MeSH

Inne numery identyfikacyjne badania

  • 71319c

Plan dla danych uczestnika indywidualnego (IPD)

Planujesz udostępniać dane poszczególnych uczestników (IPD)?

NIE

Informacje o lekach i urządzeniach, dokumenty badawcze

Bada produkt leczniczy regulowany przez amerykańską FDA

Nie

Bada produkt urządzenia regulowany przez amerykańską FDA

Nie

produkt wyprodukowany i wyeksportowany z USA

Nie

Te informacje zostały pobrane bezpośrednio ze strony internetowej clinicaltrials.gov bez żadnych zmian. Jeśli chcesz zmienić, usunąć lub zaktualizować dane swojego badania, skontaktuj się z register@clinicaltrials.gov. Gdy tylko zmiana zostanie wprowadzona na stronie clinicaltrials.gov, zostanie ona automatycznie zaktualizowana również na naszej stronie internetowej .

Subskrybuj