Ta strona została przetłumaczona automatycznie i dokładność tłumaczenia nie jest gwarantowana. Proszę odnieść się do angielska wersja za tekst źródłowy.

Bezpieczeństwo i skuteczność porównawcza czterech LLM w praktyce klinicznej

19 maja 2026 zaktualizowane przez: Hannah Galvin, Cambridge Health Alliance

Porównawcza ocena wydajności czterech publicznie dostępnych modeli dużych języków przeciwko złotym standardowym referencjom medycznym

Openevidence to narzędzie internetowe, które agreguje i syntetyzuje dane z recenzowanych badań medycznych, a następnie reakcję na pytania użytkownika za pomocą generatywnej sztucznej inteligencji. Chociaż jest on używany przez wielu klinicystów (w tym mieszkańców) dzisiaj, niewiele opublikowanych danych na temat tego, czy wyniki narzędzia są dokładne i czy informacje te odpowiednio informują o podejmowaniu decyzji klinicznych. Podobnie wielu klinicystów zwraca się do innych dużych modeli językowych (LLM), aby pomóc w podejmowaniu decyzji przy zapewnianiu opieki klinicznej. Chociaż opublikowano wiele badań na temat dokładności odpowiedzi tych LLM na pytania dotyczące komisji medycznej lub winiet klinicznych, do tej pory przeprowadzono niewiele badań badających ich wyniki w warunkach klinicznych w świecie rzeczywistym, a jeszcze mniej porównywania tej wydajności.

W tym badaniu śledczy mają dwa cele:

  1. Aby ustalić, czy zastosowanie narzędzia AI „openavidence” prowadzi do klinicznie odpowiednich decyzji, gdy jest wykorzystywane przez medycynę rodzinną, medycynę wewnętrzną i mieszkańców psychiatrii w trakcie praktyki klinicznej.
  2. Aby ustalić, w jaki sposób wynik narzędzia Openevidence porównuje się z trzema innymi powszechnie używanymi, publicznie dostępnymi modelami językowymi (Chatgpt Openai, Claude Anthropica i Gemini Google) w odpowiedzi na wspólne pytania, które mieszkańcy mają w trakcie praktyki klinicznej.

Aby osiągnąć cel badań nr 1, badacze zaciągnęli mieszkańców powyższych specjalności, aby wykorzystać narzędzie openevidence w trakcie praktyki klinicznej. Aby ograniczyć wszelkie zagrożenia bezpieczeństwa, mieszkańcy użyją również typowego narzędzia odniesienia do swojego pytania, które jest określane jako narzędzie „złota standardowe”. Narzędzia te obejmują PubMed i Uptodate. Mieszkańcy będą:

  1. Podać swoje pytanie kliniczne.
  2. Zapytanie Openevidence, przechwytując ich monit i wyjście openevidence do analizy danych. Wszyscy mieszkańcy przejdą szkolenie w zakresie szybkiej inżynierii na początku badania.
  3. Podaj swoje wnioski kliniczne w oparciu o dane openwencji.
  4. Zapytaj Złota Standard Resource.
  5. Podać ostateczny wniosek kliniczny.
  6. Odpowiedz na pytanie, czy ich wniosek kliniczny został zmodyfikowany przez odniesienie złotego standardowego.
  7. Odpowiedz na pytanie, czy mieli jakiekolwiek obawy dotyczące bezpieczeństwa klinicznego dotyczące produkcji Openvidence.

Uczęszczanie ekspertów z przedmiotu lekarza (MŚP) dopasowani specjalizacją z co najmniej 5-letnim doświadczeniem klinicznym po szkoleniu oceni odpowiedzi mieszkańców. Malcolm Gladwell wybrał 5 lat oparty na książce „Odstępcy”, w której twierdzi, że potrzebne jest 10 000 godzin skoncentrowanej praktyki, aby osiągnąć wiedzę specjalistyczną w danej dziedzinie.

MŚP zostaną poproszone o ocenę początkowych pytań klinicznych mieszkańców i ich wniosków opartych tylko na openevidence. Zostaną poproszeni o ocenę klinicznej stosowności tych wniosków w skali 1-10. W przypadku pytań, w których wskaźnik MŚP wskaźnik kliniczny wniosków mieszkańców słabo (<5/10), zostaną one poproszone o przegląd wyjścia openwencji i odpowiedź na dodatkowe pytanie, czy dane wyjściowe było niepoprawne, czy rezydent źle zinterpretował wyjście z narzędzia.

Aby osiągnąć cel nr 2, początkowy monit wprowadzony przez mieszkańców do Openevidence zostanie skopiowany przez zespół badawczy do Chatgpt, Gemini i Claude. Wyjścia z każdego narzędzia (w tym openevidence) zostaną ukazane MŚP, które zostaną poproszone o ocenę każdego wyjścia w oparciu o dokładność, kompletność i stronniczość. Do tych ocen zastosowano skale Likerta. MŚP zostaną również zadane pytanie otwarte w celu zidentyfikowania problemów bezpieczeństwa pacjenta z dowolnego z wyników.

Przegląd badań

Szczegółowy opis

Openevidence to narzędzie internetowe zbudowane z platformy klinicznej majowej przyspieszają [Openevidence], które agreguje i syntetyzuje dane z recenzowanych badań medycznych, a następnie reakcję na pytania użytkownika za pomocą generatywnej sztucznej inteligencji. Chociaż jest on używany przez wielu klinicystów (w tym mieszkańców) dzisiaj, niewiele opublikowanych danych na temat tego, czy wyniki narzędzia są dokładne i czy informacje te odpowiednio informują o podejmowaniu decyzji klinicznych. Podobnie wielu klinicystów zwraca się do innych dużych modeli językowych (LLM), aby pomóc w podejmowaniu decyzji przy zapewnianiu opieki klinicznej.

Openevidence to narzędzie internetowe zaprojektowane do agregowania i syntezy danych z recenzowanych badań klinicznych, a następnie generując odpowiedzi na zapytania użytkowników poprzez zastosowanie generatywnej sztucznej inteligencji. Chociaż coraz częściej wykorzystywane zarówno przez doświadczonych klinicystów, jak i stażystów, istnieje znaczący brak opublikowanych danych dotyczących dokładności wyników narzędzia, ich bezpieczeństwa i skuteczności w odpowiednio informowaniu o podejmowaniu decyzji klinicznych. Jednocześnie rosnąca liczba klinicystów wykorzystuje inne publicznie dostępne modele dużych języków (LLM) w celu wspierania podejmowania decyzji w zakresie opieki klinicznej. Podczas gdy w wielu badaniach zbadano dokładność odpowiedzi LLM na pytania dotyczące komisji medycznej lub winiety kliniczne, istnieją ograniczone badania ich wyników w rzeczywistych warunkach klinicznych, a jeszcze mniej badań oferuje analizy porównawcze tej wydajności.

W przeglądzie literatury jeden artykuł pokazuje, że LLM może być lepszy w wykrywaniu lęku niż lekarze, ale było to oparte na winietach klinicznych. [Levkovich i in.] Kolejne spojrzenie na diagnostyczną wrażliwość LLM stosuje zgłoszone przez pacjenta pomiary wyników w ustrukturyzowanym kwestionariuszu. [Pagano i in.] Dodatkowe badanie porównujące onkologię LLM wykorzystuje również fikcyjne winiety. [Beneary i in.] Randomizowane badanie kontrolne z wykorzystaniem winiet klinicznych nie wykazało żadnej poprawy klinicznej dla dostawców, którzy mieli dostęp do LLM. [Goh i in.] Jedno studium przypadku zbadano integrację CHATGPT 3.5 z codziennymi rundami i oceniło jego zastosowanie jakościowo, ale nie porównało go z innymi narzędziami referencyjnymi LLM lub złotymi standardowymi. [Skryd i in.] Inny porównywał odpowiedzi Chatgpt na American College of Radiology Cririteria dotyczące bólu piersi i badań przesiewowych raka piersi, ale ponownie nie porównał tego z innymi LLM. [Rao i in.] W naszym przeglądzie tylko jedno badanie oceniło LLM w prawdziwym świecie klinicznym. Była to seria artykułów, które analizowały ich zastosowanie do złożonego decyzyjnego podejmowania opieki raka piersi, przy użyciu niewielkiej liczby rzeczywistych przypadków i znormalizowanego szybkiego szablonu. [Griewing, Knitza i in.; Griewing, Gremke i in.] Badanie to wykazało, że problemy z spójnością i pogorszeniem dokładności (szczególnie w przypadku GPT 3.5), prowadząc autorów do stwierdzenia, że ​​kliniczne zastosowanie LLM w tym celu nie było jeszcze wykonalne w momencie publikacji. Mimo to liderzy systemów opieki zdrowotnej obserwują użycie tych narzędzi szybko przyspieszających w praktyce klinicznej. Z tego powodu badacze uważają, że konieczne jest zbadanie ich bezpieczeństwa i stosowności klinicznej decyzji, które podejmują klinicyści w wyniku ich użycia.

Cambridge Health Alliance (CHA) to publiczny, akademicki system opieki bezpieczeństwa w obszarze Bostonu, obsługujący zróżnicowaną populację pacjentów. CHA ma solidną podstawową opiekę i ambulatoryjną ślad psychiatrii i wspiera duży program edukacji medycznej w ramach Harvard Medical School, jak i Tufts University School of Medicine. Śledczy wybrali mieszkańców jako naszych głównych uczestników badania, ponieważ wielu stażystów już korzysta z Openevidence, i uznali ich, że są bardziej zachęcani do udziału w badaniu, jeśli otrzymają dostęp do narzędzia w ChA (gdzie w przeciwnym razie jest ono na czarnej liście usług sieciowych i zabronione przez politykę, dopóki wyniki tego badania nie zostanie ustalone).

Wyniki badań są następujące:

Ustal, czy stosowanie openevidence prowadzi do klinicznie odpowiednich decyzji przez mieszkańców w trakcie praktyki klinicznej w środowisku.

Określ, w jaki sposób wynik openevidence porównuje się z trzema innymi powszechnie używanymi, publicznie dostępnymi modelami dużych języków (Chatgpt Openai, Anthropic's Claude i Google's Gemini) pod względem dokładności, kompletności i stronniczości w celu rozwiązania problemów klinicznych mieszkańców w trakcie praktyki klinicznej w warunkach zdrowia społeczności.

Metody:

Zbieranie danych planowane jest odbywać się w okresie 6 miesięcy w celu zminimalizowania aktualizacji wersji dostawcy w okresie badania. Mieszkańcy są pogrupowani według specjalności w „medycynie” (medycyna wewnętrzna/medycyna rodzinna) i „psychiatria” (psychiatria dorosłych/dzieci). W celu uproszczenia dopasowania do odpowiednich ekspertów specjalizujących się w przedmiotach, mieszkańcy medycyny proszeni są o zastosowanie openevence tylko w przypadkach podstawowej opieki zdrowotnej dla dorosłych (z wyłączeniem problemów związanych z OB/GYN). Mieszkańcy psychiatrii proszeni są o wykorzystanie openevence tylko w przypadkach psychiatrii dorosłych.

Przed zaakceptowaniem jako uczestników stażystów zostali poproszeni o uzgodnienie następujących:

  • Sprawdź wszelkie zapytanie Openevidence przeciwko złotemu narzędziem standardowym, zdefiniowanym w protokole badania w celu obejmowania PubMed, Uptodate, Dynamed, Wytyczne społeczeństwa specjalistycznego klinicznego lub inne podobne źródło odniesienia kliniczne, które należy udokumentować w formularzu badania.
  • Nie wprowadź żadnych osobistych informacji zdrowotnych (PHI) do Openevidence (jak zdefiniowano poniżej).
  • Próba korzystania z Openevidence co najmniej 3 razy w tygodniu, w stosownych przypadkach do opieki klinicznej pacjenta.
  • Dokumentuj 100% swoich pytań openwencji w formularzu badań, aby uniknąć stronniczości selekcji.

Wszyscy mieszkańcy otrzymają krótkie szkolenie w zakresie szybkiej inżynierii opieki zdrowotnej przed rozpoczęciem gromadzenia danych. Standaryzowane podpowiedzi nie zostaną użyte, ponieważ jednym z subgoalów badania jest zrozumienie, jakie rodzaje zapytań mieszkają do openevidence w rzeczywistym świecie.

Wszyscy mieszkańcy będą wykształceni na temat definicji PHI, w następujący sposób:

Zapytania nie powinny zawierać żadnego z phi, zgodnie z definicją identyfikatorów bezpiecznych portów [HHS]; Zapytania mogą obejmować wiek pacjenta w latach (dni/tygodnie/miesiące na pediatrię) i seks prawny; Dla pacjentów w wieku 89 lat lub starszych użytkownik musi zamiast tego użyć terminu „powyżej 89 roku życia”, aby przestrzegać bezpiecznych standardów portu.

Zapytania nie powinny obejmować pacjentów podejrzanych o niezwykle rzadkie warunki zdefiniowane przez krajową organizację rzadkich zaburzeń, ponieważ są one również podatne na ponowną identyfikację [Nord]. Jeśli rzadki warunek nie zostanie początkowo podejrzewany, ale podejrzewa się w procesie badawczym korzystania z narzędzia AI, użytkownik zostanie poproszony o zatrzymanie zapytania w tym momencie.

Zbieranie danych będzie wymagało użycia formularza Google zgodnego z HIPAA w przedsiębiorstwie roboczym Enterprise Google dla infrastruktury w chmurze zdrowia. Formularz gromadzenia danych zapyta stażystów: następujące:

  1. Wprowadź pierwsze pytanie kliniczne.
  2. Wklej ich monit opendy (ponumerowany sekwencyjnie pod kątem iteracyjnych podpowiedzi) i wygenerowane pełne wyjście openevidence.
  3. Wprowadź wniosek kliniczny w oparciu o produkcję openevidence.
  4. Wprowadź użyte narzędzie odniesienia złotego standardowego.
  5. Podaj ostateczny wniosek kliniczny na podstawie informacji zarówno z Openvidence, jak i narzędzia referencyjnego złotego standardowego.
  6. Odpowiedz na pytanie dotyczące zakresu, w jakim ich początkowy wniosek kliniczny został zmodyfikowany przez złote standardowe odniesienie.
  7. Odpowiedz na otwarte pytanie, czy zauważyli jakiekolwiek problemy związane z bezpieczeństwem klinicznym, niedokładności lub stronniczości w wyniku openevence.

Zapytania będą sortowane według specjalności (medycyna vs. psychiatria), a każde zapytanie otrzyma sekwencyjny numer badania.

Zatrudniono zarząd ekspertów ds. Matternistycznych lekarzy (MŚP) w zakresie medycyny wewnętrznej, medycyny rodzinnej lub psychiatrii z co najmniej 5-letnim doświadczeniem klinicznym po szkoleniu. Pięć lat doświadczenia klinicznego po treningu zostało wybrane na podstawie faktu, że w swojej książce Malcolm Gladwell w swojej książce twierdzi, że potrzebne jest 10 000 godzin skoncentrowanej praktyki, aby osiągnąć wiedzę specjalistyczną w danej dziedzinie.

MŚP zostaną poproszone o ocenę początkowych pytań klinicznych mieszkańców i ich wniosków opartych tylko na openevidence. Zostaną poproszeni o ocenę klinicznej stosowności tych wniosków w 10-punktowej skali Likerta. MŚP zostaną również wyposażone w produkcję openwencji dla każdego zapytania, a gdy MŚP ocenia się, że kliniczna stosunek wniosków mieszkańców słabo (<5/10) zostanie dodatkowo złożony pytanie uzupełniające, aby ocenić, czy sama produkcja narzędzia zapewniła klinicznie niewłaściwą odpowiedź, w celu ustalenia, czy stażer może dokonać błędnej interpretacji narzędzia. Przegląd MŚP obejmie 2,5-5% nakładania się między recenzentami w celu obliczenia wyniku KAPPA dla niezawodności interrater.

W drugiej części badania zespół badawczy sortuje zapytania Openevidence w tematy i wybierze losowe pobieranie próbek zapytań z każdej specjalności i motywu do porównania LLM. Zespół badawczy potwierdza, że ​​podpowiedzi nie obejmują żadnego PHI zgodnie z protokołem badań. Następnie skopiują podpowiedzi openevidence wprowadzone przez mieszkańców do wybranych zapytań i wklejają je dokładnie do Chatgpt, Gemini i Claude.

Wyjścia każdego z czterech narzędzi (Openevidence, Chatgpt, Gemini i Claude) zostaną ukazane w formie internetowej Google. MŚP zostaną poproszone o ocenę każdego wyjścia w skali Likerta pod kątem dokładności, kompletności i stronniczości, a także o odpowiedź na pytanie jakościowe identyfikujące wszelkie problemy bezpieczeństwa pacjentów w wyniku.

Wyniki:

Wyniki pierwotne wyniki zostaną zgłoszone w następujący sposób:

Kliniczna adekwatność decyzji podjęta przez mieszkańców z użyciem openevence (średnia z SD, mediana), specjalność

  • Jeśli w przypadku niskiej stosowności klinicznej MŚP zidentyfikował, że nie było to spowodowane wyjściem narzędzia, ale zamiast tego z powodu interpretacji narzędzia przez rezydenta, wskaźniki zostaną również dostarczone z wykluczonymi przypadkami
  • Niezawodność między lodem (wartość kappa)

Wyniki wtórnych wyników zostaną zgłoszone w następujący sposób:

Dla każdej specjalizacji i każdej zmiennej (dokładność, kompletność i stronniczość) śledczy zgłoszą:

  • Wskaźnik „wygranej” dla każdego LLM i średniej marży z wyniku drugiego miejsca.
  • Rozmiar efektu (przy użyciu każdego LLM jako oddzielnego odniesienia) za pomocą testu D Cohena.
  • Niezawodność między lodem (wartość kappa)

Typ studiów

Obserwacyjny

Zapisy (Szacowany)

20

Kontakty i lokalizacje

Ta sekcja zawiera dane kontaktowe osób prowadzących badanie oraz informacje o tym, gdzie badanie jest przeprowadzane.

Lokalizacje studiów

    • Massachusetts
      • Cambridge, Massachusetts, Stany Zjednoczone, 02193
        • Cambridge Health Alliance

Kryteria uczestnictwa

Badacze szukają osób, które pasują do określonego opisu, zwanego kryteriami kwalifikacyjnymi. Niektóre przykłady tych kryteriów to ogólny stan zdrowia danej osoby lub wcześniejsze leczenie.

Kryteria kwalifikacji

Wiek uprawniający do nauki

  • Dziecko
  • Dorosły
  • Starszy dorosły

Akceptuje zdrowych ochotników

Tak

Metoda próbkowania

Próbka bez prawdopodobieństwa

Badana populacja

Stażyści podyplomowe w zakresie medycyny wewnętrznej, medycyny rodzinnej, psychiatrii dorosłych lub psychiatrii dziecięcej

Opis

Kryteria włączenia:

  • Aktywni stażyste PGY-1 do PGY-6 w medycynie wewnętrznej, medycynie rodzinnej, psychiatrii dorosłych lub psychiatrii dziecięcej w Cambridge Health Alliance
  • Musi zgodzić się na wymagania dotyczące protokołu badania przedstawione w opisie badania.

Kryteria wykluczenia:

  • Każdy, kto nie spełnia kryteriów włączenia
  • Mieszkańcy, którzy planują opuścić CHA przed końcem okresu zbierania badań.

Plan studiów

Ta sekcja zawiera szczegółowe informacje na temat planu badania, w tym sposób zaprojektowania badania i jego pomiary.

Jak projektuje się badanie?

Szczegóły projektu

Kohorty i interwencje

Grupa / Kohorta
Interwencja / Leczenie
Mieszkańcy medycyny
Stażyści w medycynie wewnętrznej lub medycynie rodzinnej
Mieszkańcy będą używać narzędzia odniesienia klinicznego Openvidence w trakcie rutynowej opieki klinicznej. Muszą również użyć złotego standardowego narzędzia odniesienia klinicznego (np. PubMed, uptodate) w celu ograniczenia ryzyka.
Mieszkańcy psychiatrii
Stażyści w psychiatrii dorosłych i dzieci
Mieszkańcy będą używać narzędzia odniesienia klinicznego Openvidence w trakcie rutynowej opieki klinicznej. Muszą również użyć złotego standardowego narzędzia odniesienia klinicznego (np. PubMed, uptodate) w celu ograniczenia ryzyka.

Co mierzy badanie?

Podstawowe miary wyniku

Miara wyniku
Opis środka
Ramy czasowe
Adresowność kliniczna: średnia z SD
Ramy czasowe: 6 miesięcy

Kliniczny wynik w przypadku decyzji rezydenta oparty na wyniku produkcji openevence.

Jest to wynik liczbowy w 10-punktowej skali Likerta. (W przypadku skal Likerta opisanych w tym i wszystkich naszych wskaźnikach wyników wyższe wyniki są lepszymi wynikami).

Średni wynik ze standardowym odchyleniem zostanie wykorzystany do pierwotnego wyniku.

6 miesięcy
Przywódka kliniczna: mediana
Ramy czasowe: 6 miesięcy

Kliniczny wynik w przypadku decyzji rezydenta oparty na wyniku produkcji openevence.

Jest to wynik liczbowy w 10-punktowej skali Likerta.

Zgłoszone zostaną również mediana wyników adekwatności klinicznej.

6 miesięcy
Przydatność kliniczna: wiarygodność interpretera
Ramy czasowe: 6 miesięcy

SME oceni wyniki adekwatności klinicznej decyzji rezydentów opartych na wyniku produkcji openevidence w 10-punktowej skali Likerta.

Wiarygodność interpretera wyników współczynności klinicznej MŚP zostanie obliczona przy użyciu wartości Kappa.

6 miesięcy

Miary wyników drugorzędnych

Miara wyniku
Opis środka
Ramy czasowe
Porównawcza dokładność LLM: wskaźnik wygranych
Ramy czasowe: 6 miesięcy

Porównując wyniki OPENIVIDE, CHATGPT, GEMINI i CLAUDE, MŚP oceni każde narzędzie do dokładności w 10-punktowej skali Likerta.

Niezależnie od tego, który wygrał model, otrzyma wynik „1”. Jeśli jest remis, każdy zyskuje 0,5 lub 0,33 punktu, w zależności od podziału krawata.

W przypadku każdej specjalności (medycyny i psychiatrii) i każdej LLM zgłoszą się „wskaźnik wygranych” ze średnim marginesem od drugiego miejsca LLM.

Na przykład, w przypadku wszystkich zapytań medycyny, poinformujemy o odsetku razy „Openvidence” w porównaniu z innymi LLM w skali dokładności Likerta (gdzie jest nakładanie się MŚP w celu ustalenia wartości kappa), wyznaczymy wyniki MŚP).

Jeśli chodzi o dokładność, zgłosimy wskaźnik wygranych jako procent.

6 miesięcy
Dokładność porównawcza: margines wygranej
Ramy czasowe: 6 miesięcy

Porównując wyniki OPENIVIDE, CHATGPT, GEMINI i CLAUDE, MŚP oceni każde narzędzie do dokładności w 10-punktowej skali Likerta.

W przypadku każdej specjalności (medycyny i psychiatrii) obliczymy wskaźnik wygranych dla każdej LLM pod względem dokładności, a następnie zgłosimy:

Średnia margines z 2nd Place LLM dla dokładności.

  • Jeśli remis 1. i 2. miejsca, średnia margines zostanie zgłoszony jako 0.
6 miesięcy
Dokładność porównawcza: wielkość efektu
Ramy czasowe: 6 miesięcy

Porównując wyniki OPENIVIDE, CHATGPT, GEMINI i CLAUDE, MŚP oceni każde narzędzie do dokładności w 10-punktowej skali Likerta.

W przypadku każdej specjalności (medycyny i psychiatrii) zastosujemy test D Cohena do obliczenia wielkości efektu średniego wyniku dokładności LLM w porównaniu z każdym z pozostałych trzech LLM.

Wielkość efektu 0,2 jest niewielka, 0,5 jest średnio, a 0,8 jest uważane za duże.

6 miesięcy
Dokładność porównawcza LLM: niezawodność interpreater
Ramy czasowe: 6 miesięcy

Porównując wyniki OPENIVIDE, CHATGPT, GEMINI i CLAUDE, MŚP oceni każde narzędzie do dokładności w 10-punktowej skali Likerta.

Niezawodność wzajemności wyników dokładności zostanie obliczona przy użyciu wartości Kappa.

6 miesięcy
Kompletność porównawcza LLM: Współczynnik wygranych
Ramy czasowe: 6 miesięcy

Porównując wyniki OPENIVIDE, CHATGPT, GEMINI i CLAUDE, MŚP oceni każde narzędzie do kompletności w 10-punktowej skali Likerta.

Niezależnie od tego, który wygrał model, otrzyma wynik „1”. Jeśli jest remis, każdy zyskuje 0,5 lub 0,33 punktu, w zależności od podziału krawata.

W przypadku każdej specjalności (medycyny i psychiatrii) i każdej LLM zgłoszą się „wskaźnik wygranych” ze średnim marginesem od drugiego miejsca LLM.

Na przykład, w przypadku wszystkich zapytań medycyny, poinformujemy o odsetku razy „Openvidence” w porównaniu z innymi LLM w skali dokładności Likerta (gdzie jest nakładanie się MŚP w celu ustalenia wartości kappa), wyznaczymy wyniki MŚP).

Jeśli chodzi o kompletność, zgłosimy wskaźnik wygranych jako procent.

6 miesięcy
Kompletność porównawcza: margines wygranej
Ramy czasowe: 6 miesięcy

Porównując wyniki OPENIVIDE, CHATGPT, GEMINI i CLAUDE, MŚP oceni każde narzędzie do dokładności w 10-punktowej skali Likerta.

Dla każdej specjalności (medycyna i psychiatria) obliczymy wskaźnik wygranych dla każdego LLM z kompletności, a następnie zgłaszamy:

Średnia margines z 2nd Place LLM dla kompletności.

  • Jeśli remis 1. i 2. miejsca, średnia margines zostanie zgłoszony jako 0.
6 miesięcy
Kompletność porównawcza: rozmiar efektu
Ramy czasowe: 6 miesięcy

Porównując wyniki OPENIVIDE, CHATGPT, GEMINI i CLAUDE, MŚP oceni każde narzędzie do dokładności w 10-punktowej skali Likerta.

W przypadku każdej specjalności (medycyny i psychiatrii) użyjemy testu D Cohena do obliczenia wielkości efektu średniego wyniku kompletności każdego LLM w porównaniu z każdym z pozostałych trzech LLM.

Wielkość efektu 0,2 jest niewielka, 0,5 jest średnio, a 0,8 jest uważane za duże.

6 miesięcy
Kompletność porównawcza LLM: niezawodność interrater
Ramy czasowe: 6 miesięcy

Porównując wyniki OPENIVIDE, CHATGPT, GEMINI i CLAUDE, MŚP oceni każde narzędzie do dokładności w 10-punktowej skali Likerta.

Niezawodność wyników kompletności międzyprzestrzeniowej zostanie obliczona przy użyciu wartości Kappa.

6 miesięcy
Porównawcze odchylenie LLM: Wskaźnik wygranych
Ramy czasowe: 6 miesięcy

Porównując wyniki OPENIVIDE, CHATGPT, GEMINI i CLAUDE, MŚP oceni każde narzędzie pod kątem znaków odchylenia w 10-punktowej skali Likerta.

Niezależnie od tego, który wygrał model, otrzyma wynik „1”. Jeśli jest remis, każdy zyskuje 0,5 lub 0,33 punktu, w zależności od podziału krawata.

W przypadku każdej specjalności (medycyny i psychiatrii) i każdej LLM zgłoszą się „wskaźnik wygranych” ze średnim marginesem od drugiego miejsca LLM.

Na przykład, w przypadku wszystkich zapytań medycyny, poinformujemy o odsetku razy „Openvidence” w porównaniu z innymi LLM w skali dokładności Likerta (gdzie jest nakładanie się MŚP w celu ustalenia wartości kappa), wyznaczymy wyniki MŚP).

Jeśli chodzi o stronniczość, zgłosimy wskaźnik wygranych jako procent.

6 miesięcy
Porównawcze uprzedzenie: margines wygranej
Ramy czasowe: 6 miesięcy

Porównując wyniki openevidence, Chatgpt, Gemini i Claude, MŚP oceni każde narzędzie do odchylenia w 10-punktowej skali Likerta.

Dla każdej specjalności (medycyna i psychiatria) obliczymy wskaźnik wygranych dla każdego LLM w odniesieniu do stronniczości, a następnie zgłosimy:

Średnia margines z 2nd Place LLM dla stronniczości.

  • Jeśli remis 1. i 2. miejsca, średnia margines zostanie zgłoszony jako 0.
6 miesięcy
Porównawcze odchylenie: wielkość efektu
Ramy czasowe: 6 miesięcy

Porównując wyniki OPENIVIDE, CHATGPT, GEMINI i CLAUDE, MŚP oceni każde narzędzie do dokładności w 10-punktowej skali Likerta.

W przypadku każdej specjalności (medycyny i psychiatrii) użyjemy testu D Cohena do obliczenia wielkości efektu średniego wyniku stronniczości każdego LLM w porównaniu z każdym z pozostałych trzech LLM.

Wielkość efektu 0,2 jest niewielka, 0,5 jest średnio, a 0,8 jest uważane za duże.

6 miesięcy
Porównawcze stronniczość LLM: niezawodność interpreater
Ramy czasowe: 6 miesięcy

Porównując wyniki OPENIVIDE, CHATGPT, GEMINI i CLAUDE, MŚP oceni każde narzędzie do dokładności w 10-punktowej skali Likerta.

Niezawodność interfejsu wyników stronniczości zostanie obliczona przy użyciu wartości Kappa.

6 miesięcy

Współpracownicy i badacze

Tutaj znajdziesz osoby i organizacje zaangażowane w to badanie.

Śledczy

  • Główny śledczy: Hannah K Galvin, MD, Cambridge Health Alliance

Publikacje i pomocne linki

Osoba odpowiedzialna za wprowadzenie informacji o badaniu dobrowolnie udostępnia te publikacje. Mogą one dotyczyć wszystkiego, co jest związane z badaniem.

Publikacje ogólne

Daty zapisu na studia

Daty te śledzą postęp w przesyłaniu rekordów badań i podsumowań wyników do ClinicalTrials.gov. Zapisy badań i zgłoszone wyniki są przeglądane przez National Library of Medicine (NLM), aby upewnić się, że spełniają określone standardy kontroli jakości, zanim zostaną opublikowane na publicznej stronie internetowej.

Główne daty studiów

Rozpoczęcie studiów (Rzeczywisty)

1 października 2025

Zakończenie podstawowe (Szacowany)

30 maja 2026

Ukończenie studiów (Szacowany)

30 września 2026

Daty rejestracji na studia

Pierwszy przesłany

15 września 2025

Pierwszy przesłany, który spełnia kryteria kontroli jakości

26 września 2025

Pierwszy wysłany (Rzeczywisty)

30 września 2025

Aktualizacje rekordów badań

Ostatnia wysłana aktualizacja (Rzeczywisty)

22 maja 2026

Ostatnia przesłana aktualizacja, która spełniała kryteria kontroli jakości

19 maja 2026

Ostatnia weryfikacja

1 maja 2026

Więcej informacji

Terminy związane z tym badaniem

Inne numery identyfikacyjne badania

  • CHA-IRB-25-26-444

Plan dla danych uczestnika indywidualnego (IPD)

Planujesz udostępniać dane poszczególnych uczestników (IPD)?

NIEZDECYDOWANY

Opis planu IPD

Nie przewidujemy udostępnienia indywidualnych danych uczestników lub słowników danych, ale jest to nowatorski obszar badań, więc nie jest jasne, co możemy odkryć, co może pomóc innym badaczom w przyszłości. Gdyby badania podeszły do ​​nas, a zbadanie konkretnych zapytań i odpowiedzi mogłoby pomóc w zaprojektowaniu dalszych badań, rozważylibyśmy to wraz z naszymi zespołami IRB, prawnymi i zgodności.

Informacje o lekach i urządzeniach, dokumenty badawcze

Bada produkt leczniczy regulowany przez amerykańską FDA

Nie

Bada produkt urządzenia regulowany przez amerykańską FDA

Nie

Te informacje zostały pobrane bezpośrednio ze strony internetowej clinicaltrials.gov bez żadnych zmian. Jeśli chcesz zmienić, usunąć lub zaktualizować dane swojego badania, skontaktuj się z register@clinicaltrials.gov. Gdy tylko zmiana zostanie wprowadzona na stronie clinicaltrials.gov, zostanie ona automatycznie zaktualizowana również na naszej stronie internetowej .

Badania kliniczne na AI (sztuczna inteligencja)

3
Subskrybuj