- ICH GCP
- Rejestr badań klinicznych w USA
- Badanie kliniczne NCT06911645
Rozumowanie diagnostyczne z dostosowanym modelem GPT-4
Ocena wydajności LLM i klinicystów w złożonych przypadkach diagnostycznych: randomizowane badanie kontrolowane
Przegląd badań
Status
Warunki
Szczegółowy opis
Technologie sztucznej inteligencji (AI), szczególnie zaawansowane duże modele językowe, takie jak ChatGPT Openai, mogą poprawić podejmowanie decyzji medycznych. Chociaż CHATGPT-4 nie był specjalnie zaprojektowany do zastosowań medycznych, wykazał się obietnicą w różnych kontekstach opieki zdrowotnej, w tym w pisaniu notatek medycznych, zwracaniu się do zapytań pacjentów i ułatwianiu konsultacji medycznych. Jednak jego wpływ na uzasadnienie diagnostyczne klinicystów pozostaje w dużej mierze nieznane.
Rozumowanie kliniczne jest złożonym procesem, który obejmuje rozpoznawanie wzorców, zastosowanie wiedzy i probabilistyczne rozumowanie. Integracja narzędzi AI, takich jak CHATGPT-4 z przepływami pracy lekarzy, może pomóc w zmniejszeniu obciążenia lekarza i zmniejszenia prawdopodobieństwa pominięcia diagnoz. Jednak CHATGPT-4 nie był ani opracowany, ani zatwierdzony w celu uzasadnienia diagnostycznego i może dostarczyć wprowadzających w błąd informacji, w tym prawdopodobnych, ale nieprawidłowych wniosków, które mogą wprowadzać w błąd klinicystów. Jeśli nie jest odpowiednio użyty, może się nie poprawić-i może nawet utrudniać podejmowanie decyzji. Dlatego konieczne jest zbadanie, w jaki sposób klinicyści używają dużych modeli językowych do wspierania rozumowania klinicznego przed zintegrowaniem ich z rutynową opieką nad pacjentem.
To badanie zbada, w jaki sposób natychmiastowy dostęp do dostosowanej wersji Chatgpt-4 wpływa na wydajność na zadania diagnostyczne oparte na przypadkach, w porównaniu z podejściem stopniowym. W podejściu krokowym uczestnicy najpierw użyją tradycyjnych narzędzi do wsparcia decyzji diagnostycznych, aby wspierać rozumowanie sprawy przed interakcją z dostosowanym modelem Chatgpt-4, w którym to momencie będą mieli okazję zrewidować swoje początkowe odpowiedzi.
Uczestnicy będą losowo przydzielani do różnych ramion badawczych i odpowiedzą na przypadki diagnostyczne, dostarczając trzy diagnozy różnicowe, wraz z ustaleniami wspierającymi i przeciwnymi dla każdego z nich. Zidentyfikują również swoją najlepszą diagnozę i zaproponują kolejne kroki diagnostyczne. Niezależni recenzenci, zaślepieni na przydział leczenia, ocenią swoje odpowiedzi.
Typ studiów
Zapisy (Rzeczywisty)
Faza
- Nie dotyczy
Kontakty i lokalizacje
Lokalizacje studiów
-
-
California
-
Palo Alto, California, Stany Zjednoczone, 94305
- Stanford University
-
-
Kryteria uczestnictwa
Kryteria kwalifikacji
Wiek uprawniający do nauki
- Dziecko
- Dorosły
- Starszy dorosły
Akceptuje zdrowych ochotników
Opis
Kryteria włączenia:
- Uczestnicy muszą być licencjonowanymi lekarzami i ukończyć co najmniej podyplomowe rok 1 (PGY1) szkolenia medycznego.
- Szkolenie w zakresie medycyny wewnętrznej, medycyny rodzinnej lub medycyny ratunkowej.
Kryteria wykluczenia:
- Nie praktykuje się obecnie klinicznie.
- Uczestniczył w jednym z naszych wcześniejszych badań, w których zastosowano te same sześć przypadków diagnostycznych.
Plan studiów
Jak projektuje się badanie?
Szczegóły projektu
- Główny cel: Diagnostyczny
- Przydział: Randomizowane
- Model interwencyjny: Przydział równoległy
- Maskowanie: Pojedynczy
Broń i interwencje
Grupa uczestników / Arm |
Interwencja / Leczenie |
|---|---|
|
Aktywny komparator: Natychmiastowy dostęp do dostosowanej wersji GPT-4
Grupa będzie zachęcana do natychmiastowego użycia dostosowanej wersji GPT-4.
|
Grupa ma natychmiastowy dostęp do dostosowanej wersji GPT-4 w celu obsługi ich uzasadnienia diagnostycznego dla każdego przypadku.
|
|
Aktywny komparator: Zasoby konwencjonalne najpierw, a następnie przyznały dostęp do dostosowanej wersji GPT-4.
Grupa będzie zachęcana do najpierw korzystania z wszelkich zasobów, które chcą oprócz dużych modeli językowych (Uptodate, PubMed, Google itp.), A następnie otrzyma dostęp do dostosowanej wersji GPT-4.
|
Grupa jest najpierw zachęcana do rozumowania poprzez przypadki diagnostyczne przy wsparciu zasobów konwencjonalnych.
Po przesłaniu odpowiedzi sprawy otrzymują dostęp do dostosowanej wersji GPT-4 i mają możliwość zmiany początkowych odpowiedzi.
|
Co mierzy badanie?
Podstawowe miary wyniku
Miara wyniku |
Opis środka |
Ramy czasowe |
|---|---|---|
|
Rozumowanie diagnostyczne
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
|
Podstawowym rezultatem będzie odsetek poprawnych odpowiedzi na przypadek (zakres: 0 do 100).
W każdym przypadku uczestnicy zostaną poproszeni o udzielenie trzech najlepszych diagnoz różnicowych, wraz z ustaleniami wspierającymi i przeciwnymi dla każdego z nich.
Otrzymają 1 punkt dla każdej prawdopodobnej diagnozy.
Ustalenia wspierające i przeciwne zostaną ocenione na podstawie poprawności, z 1 punktem dla częściowo poprawnej odpowiedzi i 2 punktami dla całkowicie poprawnej odpowiedzi.
Następnie uczestnicy wybiorą swoją najlepszą diagnozę, zdobywając 1 punkt dla rozsądnego wyboru i 2 punkty dla najdokładniejszej diagnozy.
Wreszcie, wymienili do trzech kolejnych kroków w celu dalszej oceny pacjenta, z 1 punktem przyznanym za częściowo poprawną odpowiedź i 2 punkty za całkowicie poprawną odpowiedź.
Podstawowy wynik zostanie przeanalizowany na poziomie przypadku, porównując wydajność między randomizowanymi grupami badawczymi.
|
Poprzez zakończenie badania średnio 6 miesięcy
|
Miary wyników drugorzędnych
Miara wyniku |
Opis środka |
Ramy czasowe |
|---|---|---|
|
Czas spędzony na sprawę
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
|
Śledczy porównają średni czas (w ciągu kilku minut) uczestnicy wydają na każdą sprawę na dwóch ramionach badań.
|
Poprzez zakończenie badania średnio 6 miesięcy
|
|
Szybka częstotliwość
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
|
Śledczy porównują częstotliwość podpowiedzi uczestnika z dostosowanym modelem GPT-4 między dwiema grupami badawczymi.
|
Poprzez zakończenie badania średnio 6 miesięcy
|
|
Sentyment
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
|
Śledczy porównają ton i sentyment podpowiedzi uczestnika z dostosowanym modelem GPT-4 w dwóch grupach badawczych.
Śledczy utworzą jakościowy system kodowania, aby skategoryzować charakter podpowiedzi uczestników.
|
Poprzez zakończenie badania średnio 6 miesięcy
|
|
Postrzeganie przez uczestników sztucznej inteligencji w rozumowaniu klinicznym
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
|
Wynik ten zostanie oceniony w obu ramionach badań i obejmowałby zmiany postaw, pewności siebie i gotowości do korzystania z narzędzi diagnostycznych AI przed i po wystawieniu na narzędzie spersonalizowanego.
Ocenimy liczbę uczestników, którzy byli otwarci na korzystanie z AI w celu pomocy w złożonym rozumowaniu klinicznym (przed- i po Quizie), jeśli lubili pracę z narzędziem diagnostycznym AI, jeśli czują, że narzędzie zapewniło cenne doświadczenie współpracy do rozumowania klinicznego, jeśli zobaczenie zaleceń diagnostycznych AI zwiększyło ich zaufanie do ich różnicowych diagnozów, a jeśli wykorzystają to narzędzie diagnostyczne AI takie jak to w tym badaniu w tym miejscu pracy.
Zostaną one ocenione w rankingu skali Likerta od silnego nie zgadzania się na zdecydowanie się zgodzić.
|
Poprzez zakończenie badania średnio 6 miesięcy
|
|
Dostosowane rozumowanie diagnostyczne GPT-4
Ramy czasowe: Poprzez zakończenie badania średnio 6 miesięcy
|
Dostosowane „niezależne” diagnozy GPT-4 zostaną ocenione pod kątem dokładności.
Rezultatem będzie odsetek poprawnych odpowiedzi na przypadek (zakres: 0 do 100).
W każdym przypadku meta-Prompt kieruje dostosowanym GPT-4, aby zapewnić trzy najważniejsze diagnozy różnicowe, wraz z ustaleniami wspierającymi i przeciwnymi dla każdej, ostatecznej diagnozy i kolejnych kroków.
Dostosowany GPT-4 otrzyma 1 punkt dla każdej prawdopodobnej diagnozy.
Ustalenia wspierające i przeciwne zostaną ocenione na podstawie poprawności, z 1 punktem dla częściowo poprawnej odpowiedzi i 2 punktami dla całkowicie poprawnej odpowiedzi.
Jego najwyższa diagnoza przyniesie 1 punkt dla rozsądnego wyboru i 2 punkty dla najdokładniejszej diagnozy.
Wreszcie, wymieniono do trzech kolejnych kroków w celu dalszej oceny pacjenta, z 1 punktem przyznanym za częściowo poprawną odpowiedź i 2 punkty za całkowicie poprawną odpowiedź.
Wynik zostanie przeanalizowany na poziomie przypadku, w porównaniu z wynikami randomizowanymi grupami badań.
|
Poprzez zakończenie badania średnio 6 miesięcy
|
Współpracownicy i badacze
Sponsor
Współpracownicy
Śledczy
- Główny śledczy: Jonathan H Chen, MD, PhD, Stanford University
Daty zapisu na studia
Główne daty studiów
Rozpoczęcie studiów (Rzeczywisty)
Zakończenie podstawowe (Rzeczywisty)
Ukończenie studiów (Rzeczywisty)
Daty rejestracji na studia
Pierwszy przesłany
Pierwszy przesłany, który spełnia kryteria kontroli jakości
Pierwszy wysłany (Rzeczywisty)
Aktualizacje rekordów badań
Ostatnia wysłana aktualizacja (Rzeczywisty)
Ostatnia przesłana aktualizacja, która spełniała kryteria kontroli jakości
Ostatnia weryfikacja
Więcej informacji
Terminy związane z tym badaniem
Dodatkowe istotne warunki MeSH
Inne numery identyfikacyjne badania
- 71319c
Plan dla danych uczestnika indywidualnego (IPD)
Planujesz udostępniać dane poszczególnych uczestników (IPD)?
Informacje o lekach i urządzeniach, dokumenty badawcze
Bada produkt leczniczy regulowany przez amerykańską FDA
Bada produkt urządzenia regulowany przez amerykańską FDA
produkt wyprodukowany i wyeksportowany z USA
Te informacje zostały pobrane bezpośrednio ze strony internetowej clinicaltrials.gov bez żadnych zmian. Jeśli chcesz zmienić, usunąć lub zaktualizować dane swojego badania, skontaktuj się z register@clinicaltrials.gov. Gdy tylko zmiana zostanie wprowadzona na stronie clinicaltrials.gov, zostanie ona automatycznie zaktualizowana również na naszej stronie internetowej .