Ta strona została przetłumaczona automatycznie i dokładność tłumaczenia nie jest gwarantowana. Proszę odnieść się do angielska wersja za tekst źródłowy.

Wzbogacenie Rozumowania z Informacją Zwrotną od SI w Badaniu Nefrologicznym (REFINe)

12 stycznia 2026 zaktualizowane przez: Aghiles.HAMROUN, University Hospital, Lille

Poprawa Rozumowania z Wsparciem Generatywnej Sztucznej Inteligencji w Nefrologii (REFINe): Randomizowana Ocena Wsparcia Generatywnej Sztucznej Inteligencji w Diagnostyce Nefrologicznej

Celem tego badania klinicznego jest poznanie, jak sztuczna inteligencja (AI) może pomóc lekarzom w stawianiu diagnoz w nefrologii. Badacze chcą się dowiedzieć, czy narzędzie AI zwane dużym modelem językowym (LLM) może pomóc lekarzom częściej wybierać prawidłową diagnozę i czuć się pewniej w swoich odpowiedziach.

Przed rozpoczęciem badania zespół badawczy przetestował kilka modeli AI i wybrał jednego z najlepszych, model klasy GPT-5 ustawiony na wysokie nakłady rozumowania.

Główne pytania, na które to badanie ma odpowiedzieć, to:

  1. Czy lekarze stawiają więcej prawidłowych diagnoz, gdy mogą zobaczyć sugestie AI?
  2. Czy widzenie sugestii AI zmienia to, jak pewnie lekarze czują się w swojej diagnozie?

Badacze porównają lekarzy, którzy otrzymują sugestie AI, z lekarzami, którzy ich nie otrzymują, aby zobaczyć, jak AI wpływa na dokładność, pewność siebie i podejmowanie decyzji.

Uczestnicy wypełnią do 10 przypadków klinicznych online. W każdym przypadku będą:

  1. Czytać krótki scenariusz medyczny
  2. Sugerować do trzech możliwych diagnoz

(Jeśli w grupie AI) Przejrzeć sugestie AI i zdecydować, czy zmienić swoją odpowiedź

Badanie będzie również analizować, ile czasu uczestnicy poświęcają na odpowiedź w każdym przypadku oraz jak wyniki AI mają się do odpowiedzi ludzkich.

Przegląd badań

Szczegółowy opis

To badanie ocenia, czy dostarczenie klinicystom sugestii diagnostycznych w czasie rzeczywistym z zaawansowanego modelu językowego o wysokiej zdolności wnioskowania (GPT-5) poprawia dokładność diagnostyczną, pewność siebie oraz efektywność przy rozwiązywaniu przypadków klinicznych z nefrologii. Przed wyborem modelu do badania zespół badawczy porównał kilka najnowocześniejszych modeli na pilotażowym zestawie przypadków nefrologicznych, w tym: GPT-5, GPT-5-mini, O3, GPT-4o, Llama-4 Maverick-17B, Gemini-2.5-Pro, Qwen-3 VL-235B Thinking, DeepSeek-V3.2-Exp, MedGEMMA-27B, Claude Sonnet-4.5 i Magistral-Medium-2509. GPT-5 (wysoka zdolność wnioskowania) wykazał najwyższą wydajność diagnostyczną, stabilność i interpretowalność, i został wybrany jako system AI stosowany w ramieniu interwencyjnym.

Uczestnicy obejmują studentów medycyny, rezydentów, stażystów i praktykujących lekarzy. Po utworzeniu konta uczestnicy wypełniają kwestionariusz demograficzny (specjalizacja, lata doświadczenia, rodzaj praktyki, kategoria wiekowa, znajomość AI) i muszą wyraźnie wyrazić zgodę na wykorzystanie tych danych do celów badawczych przed dostępem do przypadków. Nie są zbierane bezpośrednie dane identyfikujące.

Uczestnicy są randomizowani (z warstwowaniem według statusu zawodowego) do ramienia wspieranego przez AI lub ramienia kontrolnego. Każdy uczestnik otrzymuje 10 przypadków nefrologicznych w języku francuskim lub angielskim i może je rozwiązywać w wielu sesjach. Po przesłaniu przypadku nie można do niego wrócić ("brak cofania"). Czas wykonania na przypadek jest automatycznie rejestrowany.

Ramię Kontrolne

Uczestnicy przeglądają każdy przypadek i podają do trzech diagnoz ("Top-3"), a następnie ocenę pewności (0-10).

Ramię Wspierane przez AI

Uczestnicy najpierw wprowadzają wstępne diagnozy Top-3 i ocenę pewności bez pomocy AI. System następnie wyświetla sugestie diagnostyczne GPT-5, po czym uczestnicy mogą raz poprawić swoje diagnozy. Przypadek jest blokowany po przesłaniu.

Badanie zbiera:

  • diagnozy początkowe i końcowe,
  • oceny pewności przed i (jeśli dotyczy) po sugestiach AI,
  • czasy wykonania,
  • zmienne demograficzne uczestników,
  • oraz własne wyniki diagnostyczne modelu AI.

Dopuszczalne jest częściowe ukończenie; wszystkie ukończone przypadki przyczyniają się do analizy.

Pierwszorzędowe i drugorzędowe punkty końcowe obejmują dokładność diagnostyczną (Top-3 i Top-1), poprawę dokładności przed vs. po AI, zmiany w pewności diagnostycznej, błędy diagnostyczne wywołane przez AI, porównanie człowiek vs. AI, wskaźniki efektywności czasu wykonania oraz odsetek przypisanych przypadków ukończonych.

Analiza pierwszorzędowa porówna dokładność diagnostyczną między ramieniem kontrolnym (lekarze samodzielnie) a ramieniem eksperymentalnym (lekarze wspierani przez model AI). Dokładność jest analizowana jako wynik binarny (diagnoza poprawna vs. niepoprawna). Ponieważ każdy uczestnik ocenia wiele przypadków klinicznych, dokładność będzie modelowana za pomocą logistycznej regresji efektów mieszanych z efektem stałym dla ramienia badania i losowymi punktami przecięcia dla uczestnika i przypadku. To podejście uwzględnia grupowanie i różną trudność przypadków. Test hipotezy pierwszorzędowej używa dwustronnego α = 0,05. Wielkości efektów będą raportowane jako ilorazy szans z 95% przedziałami ufności. Analizy drugorzędowe zbadają, czy dokładność różni się w zależności od czynników demograficznych (np. poziom doświadczenia, specjalizacja) za pomocą terminów interakcji.

Ponieważ każdy uczestnik ocenia wiele przypadków, zespół przeprowadził również analizy mocy oparte na symulacji z użyciem modeli logistycznej regresji efektów mieszanych z losowymi punktami przecięcia dla uczestnika i przypadku, przy założeniu ICC wewnątrzuczestniczego 0,10. Przy tych założeniach, całkowita próba 100 uczestników (50 na ramię) z 10 przypadkami na uczestnika zapewnia >99% mocy do wykrycia klinicznie znaczącej poprawy w dokładności diagnostycznej. Badacze planują zatem zrekrutować około 100 uczestników ogółem.

To badanie ma na celu określenie, czy rozumowanie wspierane przez AI znacząco poprawia wydajność diagnostyczną i podejmowanie decyzji, gdy klinicyści oceniają złożone przypadki nefrologiczne.

Typ studiów

Interwencyjne

Zapisy (Szacowany)

100

Faza

  • Nie dotyczy

Kontakty i lokalizacje

Ta sekcja zawiera dane kontaktowe osób prowadzących badanie oraz informacje o tym, gdzie badanie jest przeprowadzane.

Kontakt w sprawie studiów

Lokalizacje studiów

Kryteria uczestnictwa

Badacze szukają osób, które pasują do określonego opisu, zwanego kryteriami kwalifikacyjnymi. Niektóre przykłady tych kryteriów to ogólny stan zdrowia danej osoby lub wcześniejsze leczenie.

Kryteria kwalifikacji

Wiek uprawniający do nauki

  • Dorosły
  • Starszy dorosły

Akceptuje zdrowych ochotników

Tak

Opis

Kryteria włączenia:

Dorośli w wieku 18 lat lub starsi.

Umiejętność czytania i odpowiadania na opisy przypadków klinicznych w języku angielskim lub francuskim.

Dostęp do komputera lub smartfona z połączeniem internetowym.

Wyrażenie świadomej zgody online.

Oczekuje się, że uczestnicy będą mieli co najmniej podstawowe przeszkolenie medyczne (np. studenci medycyny, rezydenci, stażyści lub praktykujący klinicyści), chociaż formalne potwierdzenie nie jest wymagane.

Kryteria wykluczenia:

Osoby poniżej 18 roku życia.

Niezdolność do ukończenia procedur badania online.

Wcześniejsze zaangażowanie w projektowanie, rozwój lub ocenę systemu AI użytego w tym badaniu.

Plan studiów

Ta sekcja zawiera szczegółowe informacje na temat planu badania, w tym sposób zaprojektowania badania i jego pomiary.

Jak projektuje się badanie?

Szczegóły projektu

  • Główny cel: Diagnostyczny
  • Przydział: Randomizowane
  • Model interwencyjny: Przydział równoległy
  • Maskowanie: Brak (otwarta etykieta)

Broń i interwencje

Grupa uczestników / Arm
Interwencja / Leczenie
Eksperymentalny: Grupa z sugestiami AI
Uczestnicy w tym ramieniu wykonają te same przypadki kliniczne co grupa kontrolna. W każdym przypadku otrzymają sugerowaną diagnozę wygenerowaną przez duży model językowy (GPT-5, konfiguracja wysokiego rozumowania), który został wybrany po wewnętrznym benchmarkingu. Uczestnicy mogą przejrzeć sugestię AI przed wprowadzeniem własnej ostatecznej odpowiedzi diagnostycznej. Nie zapewnia się żadnych dodatkowych informacji, podpowiedzi ani wsparcia. Interwencja polega wyłącznie na wyświetleniu wygenerowanej przez AI sugestii diagnostycznej podczas zadania rozwiązywania przypadku.
Ta interwencja polega na wyświetlaniu sugestii diagnostycznej wygenerowanej przez sztuczną inteligencję podczas rozwiązywania przypadków klinicznych. Po przeczytaniu każdej wizytówki uczestnicy widzą główną propozycję diagnostyczną wygenerowaną przez duży model językowy (GPT-5, konfiguracja wysokiego rozumowania), wybraną po wewnętrznych testach porównawczych. Sugestia AI pojawia się raz na wizytówkę i nie można jej ponownie zażądać ani zmodyfikować. Uczestnicy mogą poprawić swoją odpowiedź diagnostyczną po obejrzeniu sugestii, ale nie mogą później wrócić do wizytówki. Nie zapewnia się dodatkowych wskazówek, coachingu ani funkcji interaktywnych.
Brak interwencji: Grupa bez sugestii SI
Uczestnicy w tej grupie samodzielnie rozwiążą opisy przypadków klinicznych, bez żadnych sugestii diagnostycznych generowanych przez sztuczną inteligencję. Przeczytają każdy opis i podadzą własną odpowiedź diagnostyczną opartą wyłącznie na przedstawionych informacjach. Nie zapewnia się zewnętrznego wsparcia decyzyjnego ani dodatkowych materiałów.

Co mierzy badanie?

Podstawowe miary wyniku

Miara wyniku
Opis środka
Ramy czasowe
Ostateczna dokładność diagnostyczna (top-3) z vs bez wsparcia AI
Ramy czasowe: Od pierwszej odpowiedzi w scenariuszu do końca badania (do 12 miesięcy).

Dla każdego uczestnika, odsetek scenariuszy, w których prawidłowa główna diagnoza jest zawarta w ostatecznej trójce głównych diagnoz uczestnika. Porównanie dokładności ostatecznej trójki głównych diagnoz między ramieniem AI (po sugestiach AI) a ramieniem kontrolnym (bez AI).

Procent poprawnie zdiagnozowanych przypadków (w pierwszej trójce).

Od pierwszej odpowiedzi w scenariuszu do końca badania (do 12 miesięcy).

Miary wyników drugorzędnych

Miara wyniku
Opis środka
Ramy czasowe
Ostateczna dokładność diagnostyczna (top-1) z vs bez wsparcia AI
Ramy czasowe: Od pierwszej odpowiedzi na scenkę do końca badania (do 12 miesięcy).
Dla każdego uczestnika, odsetek wignetów, w których prawidłowa główna diagnoza została uwzględniona w ostatecznych diagnozach top-1 uczestnika. Porównanie ostatecznej dokładności top-1 między ramieniem AI (po sugestiach AI) a ramieniem kontrolnym (bez AI). Odsetek prawidłowo zdiagnozowanych przypadków (top-1).
Od pierwszej odpowiedzi na scenkę do końca badania (do 12 miesięcy).
Zmiana dokładności diagnostycznej top-3 przed i po sugestiach AI (tylko grupa AI)
Ramy czasowe: Od pierwszej odpowiedzi na wignecie do końca badania (do 12 miesięcy).

W ramieniu wspieranym przez sztuczną inteligencję uczestnicy najpierw podają wstępną odpowiedź (do trzech diagnoz) bez sugestii AI, następnie widzą sugestie wygenerowane przez AI i mogą raz poprawić swoją odpowiedź; nie mogą później wrócić do tego przypadku. Dla każdego uczestnika badacze obliczają różnicę w dokładności wśród trzech najlepszych diagnoz między odpowiedziami wstępnymi i końcowymi we wszystkich ukończonych przypadkach.

Zmiana procentowa w dokładności diagnostycznej wśród trzech najlepszych diagnoz

Od pierwszej odpowiedzi na wignecie do końca badania (do 12 miesięcy).
Zmiana w dokładności diagnostycznej top-1 przed a po sugestiach AI (tylko grupa AI)
Ramy czasowe: Od momentu odpowiedzi na pierwszą wizytówkę do końca badania (do 12 miesięcy).

W grupie wspieranej przez SI uczestnicy najpierw podają wstępną odpowiedź (do trzech diagnoz) bez sugestii SI, następnie widzą sugestie wygenerowane przez SI i mogą raz poprawić swoją odpowiedź; nie mogą później wrócić do tego przypadku. Dla każdego uczestnika badacze obliczają różnicę w dokładności top-1 między odpowiedziami początkowymi i końcowymi we wszystkich ukończonych przypadkach.

Zmiana procentowa w dokładności diagnostycznej Top-1

Od momentu odpowiedzi na pierwszą wizytówkę do końca badania (do 12 miesięcy).
Pewność diagnostyczna (0-10) przed sugestiami AI: grupa kontrolna vs grupa AI
Ramy czasowe: Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).

Uczestnicy w obu grupach oceniają swoje zaufanie (w skali 0-10) do swoich trzech najlepszych propozycji diagnostycznych przed otrzymaniem jakichkolwiek sugestii AI.

W grupie AI jest to ocena „przed AI”. W grupie kontrolnej jest to pojedyncza ocena zaufania (ponieważ AI nie jest pokazywane).

Badacze porównują zaufanie przed AI między grupami, agregując wyniki wszystkich ukończonych scenariuszy na uczestnika.

Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).
Ostateczna pewność diagnostyczna (0-10) po sugestiach AI: Grupa kontrolna vs grupa AI
Ramy czasowe: Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).

Ostateczna pewność diagnostyczna (skala 0-10) w ramach 3 najlepszych propozycji diagnostycznych we wszystkich ukończonych studiach przypadku, porównana między grupami.

W grupie z AI jest to ocena pewności po zastosowaniu AI. W grupie kontrolnej jest to ta sama ocena pewności (uczestnicy nie otrzymują sugestii AI).

Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).
Zmiana pewności diagnostycznej (0-10) przed vs po sugestiach AI (tylko grupa AI)
Ramy czasowe: Od pierwszej odpowiedzi na winietę do końca badania (do 12 miesięcy).

W grupie AI uczestnicy podają oceny pewności (w skali 0-10) dla swoich trzech głównych diagnoz zarówno przed, jak i po zapoznaniu się z sugestiami AI.

Dla każdego uczestnika badacze obliczają zmianę wewnątrzosobniczą (po AI minus przed AI) we wszystkich ukończonych wignetykach.

Zmiana w wyniku pewności (skala 0-10)

Od pierwszej odpowiedzi na winietę do końca badania (do 12 miesięcy).
Błąd diagnostyczny wywołany sztuczną inteligencją (tylko grupa AI)
Ramy czasowe: Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).
Wśród ukończonych wizualizacji, w których początkowe Top-1 rozpoznanie uczestnika jest poprawne, proporcja, dla której końcowe Top-1 rozpoznanie staje się niepoprawne po sugestiach AI.
Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).
Zmiana w trzech głównych diagnozach po sugestiach AI (tylko ramię AI)
Ramy czasowe: Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).
Wśród ukończonych opisów przypadków w ramieniu AI, odsetek, w którym diagnoza Top-3 różni się między odpowiedziami przed AI i po AI.
Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).
Najlepsza dokładność diagnostyczna 3: Wszystkie odpowiedzi ludzkie przed AI vs dokładność AI
Ramy czasowe: Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).

Dla każdej wizytówki, dokładność diagnostyczna Top-3 uczestników przed jakimikolwiek sugestiami AI (łącząc uczestników z obu ramion badania na ich etapie przed-AI) jest porównywana z dokładnością diagnostyczną Top-3 modelu AI dla tej samej wizytówki. Raportowany Wynik to różnica w dokładności, zdefiniowana jako dokładność Top-3 AI minus dokładność Top-3 człowieka przed AI, wyrażona w punktach procentowych i obliczona na poziomie wizytówki we wszystkich ukończonych wizytówkach.

Różnica w punktach procentowych w dokładności diagnostycznej Top-3

Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).
Top-3 dokładność diagnostyczna: Ostateczne odpowiedzi człowieka po AI vs dokładność AI (tylko ramię AI)
Ramy czasowe: Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).

Dla każdej ukończonej wizytówki w ramieniu wspieranym przez AI, dokładność diagnostyczna Top-3 uczestników ludzkich po obejrzeniu sugestii AI jest porównywana z dokładnością diagnostyczną Top-3 modelu AI.

(Dokładność Top-3 jest pojedynczym wskaźnikiem) Raportowany wynik to różnica dokładności, zdefiniowana jako dokładność Top-3 AI minus dokładność Top-3 człowieka po AI, wyrażona w punktach procentowych i obliczona na poziomie wizytówki we wszystkich ukończonych wizytówkach w ramieniu AI.

Różnica punktów procentowych w dokładności diagnostycznej Top-3 między AI a człowiekiem

Od pierwszej odpowiedzi na winiety do końca badania (do 12 miesięcy).
Czas realizacji na wignecie z wsparciem AI i bez niego
Ramy czasowe: Od pierwszej odpowiedzi na scenariusz do końca badania (do 12 miesięcy).

Dla każdej wizytówki platforma rejestruje czas od otwarcia wizytówki do przesłania odpowiedzi. W ramieniu kontrolnym dla każdej wizytówki rejestrowany jest pojedynczy czas ukończenia. W ramieniu wspieranym przez AI czas ukończenia jest rejestrowany przed wyświetleniem sugestii AI i ponownie po ich wyświetleniu. Wynik podaje różnicę w czasie ukończenia między ramionami badania, wyrażoną w sekundach i obliczoną dla wszystkich ukończonych wizytówek.

Sekundy (różnica w czasie ukończenia)

Od pierwszej odpowiedzi na scenariusz do końca badania (do 12 miesięcy).
Proporcja przypisanych scenariuszy ukończonych
Ramy czasowe: Od momentu udzielenia odpowiedzi na pierwszą wignettę do zakończenia badania (do 12 miesięcy).
Dla każdego uczestnika, odsetek 10 opowieści ukończonych w okresie badania, porównany między grupami.
Od momentu udzielenia odpowiedzi na pierwszą wignettę do zakończenia badania (do 12 miesięcy).

Współpracownicy i badacze

Tutaj znajdziesz osoby i organizacje zaangażowane w to badanie.

Daty zapisu na studia

Daty te śledzą postęp w przesyłaniu rekordów badań i podsumowań wyników do ClinicalTrials.gov. Zapisy badań i zgłoszone wyniki są przeglądane przez National Library of Medicine (NLM), aby upewnić się, że spełniają określone standardy kontroli jakości, zanim zostaną opublikowane na publicznej stronie internetowej.

Główne daty studiów

Rozpoczęcie studiów (Rzeczywisty)

20 listopada 2025

Zakończenie podstawowe (Szacowany)

31 października 2026

Ukończenie studiów (Szacowany)

31 grudnia 2026

Daty rejestracji na studia

Pierwszy przesłany

19 listopada 2025

Pierwszy przesłany, który spełnia kryteria kontroli jakości

12 stycznia 2026

Pierwszy wysłany (Rzeczywisty)

20 stycznia 2026

Aktualizacje rekordów badań

Ostatnia wysłana aktualizacja (Rzeczywisty)

20 stycznia 2026

Ostatnia przesłana aktualizacja, która spełniała kryteria kontroli jakości

12 stycznia 2026

Ostatnia weryfikacja

1 stycznia 2026

Więcej informacji

Terminy związane z tym badaniem

Informacje o lekach i urządzeniach, dokumenty badawcze

Bada produkt leczniczy regulowany przez amerykańską FDA

Nie

Bada produkt urządzenia regulowany przez amerykańską FDA

Nie

Te informacje zostały pobrane bezpośrednio ze strony internetowej clinicaltrials.gov bez żadnych zmian. Jeśli chcesz zmienić, usunąć lub zaktualizować dane swojego badania, skontaktuj się z register@clinicaltrials.gov. Gdy tylko zmiana zostanie wprowadzona na stronie clinicaltrials.gov, zostanie ona automatycznie zaktualizowana również na naszej stronie internetowej .

Subskrybuj