Ta strona została przetłumaczona automatycznie i dokładność tłumaczenia nie jest gwarantowana. Proszę odnieść się do angielska wersja za tekst źródłowy.

AI kontra człowiek – ocena i rozwój egzaminów (badanie AHEAD) (AHEAD)

16 marca 2026 zaktualizowane przez: Anita Palepu, University of British Columbia

Psychometryczne Właściwości i Percepcje Studentów Dotyczące Tworzenia Pytań Wielokrotnego Wyboru przez AI w Porównaniu z Pytaniami Tworzonymi przez Człowieka w Edukacji Medycznej: Randomizowane Badanie Kontrolowane AHEAD

Badanie porównawcze oceny i rozwoju sztucznej inteligencji (AI) a człowieka (AHEAD) to randomizowane badanie kontrolowane z zaślepieniem uczestników przeprowadzone wśród studentów pierwszego roku medycyny na Uniwersytecie Kolumbii Brytyjskiej. Badanie ocenia, czy pytania egzaminacyjne wielokrotnego wyboru generowane przy użyciu dużych modeli językowych (LLM) sprawdzają się porównywalnie z tradycyjnymi pytaniami pisanymi przez człowieka w edukacji medycznej.

Uczestnicy zostali losowo przydzieleni do wypełnienia jednej z dwóch wersji formatywnego egzaminu próbnego końcowego, składającego się z 112 pytań wielokrotnego wyboru typu pojedyncza najlepsza odpowiedź opartych na przypadkach (MCQ), zgodnych z tymi samymi celami edukacyjnymi kursu. Jedna wersja egzaminu zawierała pytania wygenerowane przez AI przy użyciu ustrukturyzowanego przepływu pracy LLM z niezależną weryfikacją AI, podczas gdy druga zawierała pytania napisane przez starszych studentów medycyny przy użyciu konwencjonalnych metod.

Badanie ocenia wykonalność egzaminu, rzetelność psychometryczną, trafność, akceptowalność przez studentów oraz wpływ edukacyjny. Wyniki obejmują wyniki egzaminu, wskaźniki dyskryminacji pozycji, efektywność dystraktorów, postrzeganie przez studentów jakości i trudności egzaminu oraz zmiany w postrzeganym przygotowaniu do nadchodzącego egzaminu sumatywnego.

Przegląd badań

Szczegółowy opis

Badanie AHEAD (AI vs Human Exam Assessment and Development) to jednostkowe, zaślepione dla uczestników randomizowane badanie kontrolowane przeprowadzone wśród studentów pierwszego roku studiów lekarskich (MD) zapisanych na kurs Podstaw Praktyki Medycznej I (MEDD 411) na Uniwersytecie Kolumbii Brytyjskiej.

Uczestnicy zostali randomizowani w stosunku 1:1, aby wypełnić albo wygenerowany przez sztuczną inteligencję (AI), albo stworzony przez człowieka próbny egzamin końcowy. Oba egzaminy składały się z 112 pytań wielokrotnego wyboru (MCQ) typu pojedyncza najlepsza odpowiedź, opartych na przypadkach i zgodnych z tymi samymi celami programowymi MEDD 411.

Pytania wygenerowane przez AI zostały stworzone przy użyciu ustrukturyzowanego procesu obejmującego ChatGPT do generowania pytań i Google Gemini do niezależnej weryfikacji. Pytania stworzone przez człowieka zostały opracowane przez starszych studentów medycyny bez pomocy AI i przeszły niezależną recenzję koleżeńską. Oba egzaminy stosowały identyczne wytyczne formatowania i oceniały te same cele edukacyjne.

Wszyscy uczestnicy wypełnili identyczne ankiety przed i po egzaminie, oceniające cechy demograficzne, znajomość sztucznej inteligencji w edukacji oraz postrzeganie doświadczenia egzaminacyjnego. Badanie ocenia użyteczność ocen wygenerowanych przez AI przy użyciu Ram Użyteczności Oceny van der Vleutena, obejmujących wykonalność, rzetelność, trafność, akceptowalność i wpływ edukacyjny.

Badanie ma na celu ustalenie, czy duże modele językowe mogą przyspieszyć rozwój formatywnych egzaminów medycznych, przy jednoczesnym utrzymaniu porównywalnej jakości psychometrycznej i wartości edukacyjnej w stosunku do tradycyjnych pytań opracowanych przez człowieka.

Typ studiów

Interwencyjne

Zapisy (Rzeczywisty)

258

Faza

  • Nie dotyczy

Kontakty i lokalizacje

Ta sekcja zawiera dane kontaktowe osób prowadzących badanie oraz informacje o tym, gdzie badanie jest przeprowadzane.

Lokalizacje studiów

    • British Columbia
      • Vancouver, British Columbia, Kanada, V5Z 1M9
        • University of British Columbia Faculty of Medicine

Kryteria uczestnictwa

Badacze szukają osób, które pasują do określonego opisu, zwanego kryteriami kwalifikacyjnymi. Niektóre przykłady tych kryteriów to ogólny stan zdrowia danej osoby lub wcześniejsze leczenie.

Kryteria kwalifikacji

Wiek uprawniający do nauki

  • Dorosły
  • Starszy dorosły

Akceptuje zdrowych ochotników

Tak

Opis

Kryteria włączenia:

  • Studenci pierwszego roku medycyny zapisani na program studiów licencjackich MD Uniwersytetu Kolumbii Brytyjskiej.
  • Mogą dobrowolnie wyrazić zgodę na udział w badaniu formatywnym symulowanego egzaminu.

Kryteria wykluczenia:

  • Studenci, którzy odmówili udziału.
  • Studenci, którzy nie ukończyli symulowanego egzaminu lub wymaganych ankiet.

Plan studiów

Ta sekcja zawiera szczegółowe informacje na temat planu badania, w tym sposób zaprojektowania badania i jego pomiary.

Jak projektuje się badanie?

Szczegóły projektu

  • Główny cel: Inny
  • Przydział: Randomizowane
  • Model interwencyjny: Przydział równoległy
  • Maskowanie: Pojedynczy

Broń i interwencje

Grupa uczestników / Arm
Interwencja / Leczenie
Eksperymentalny: Egzamin z pytaniami wielokrotnego wyboru generowanymi przez sztuczną inteligencję
Uczestnicy wypełnili 112-punktowy, oparty na przypadkach, imitacyjny egzamin typu single-best-answer, składający się z wygenerowanych przez sztuczną inteligencję pytań wielokrotnego wyboru. Pytania zostały wygenerowane przy użyciu ustrukturyzowanego procesu pracy z dużym modelem językowym z ChatGPT-4 do generowania i Google Gemini do niezależnej walidacji.
Formacyjny próbny egzamin składający się z 112 pytań wielokrotnego wyboru opartych na przypadkach, wygenerowanych przy użyciu dużych modeli językowych zgodnych z celami edukacyjnymi kursu.
Aktywny komparator: Egzamin z pytaniami wielokrotnego wyboru opracowany przez człowieka
Uczestnicy wypełnili 112-punktowe, oparte na przypadkach, jednoprawidłowe-odpowiedzi, próbne egzamin, złożony z opracowanych przez człowieka pytań wielokrotnego wyboru, stworzonych przez studentów medycyny ostatnich lat studiów, z wykorzystaniem tradycyjnych metod tworzenia zadań oraz recenzji koleżeńskiej.
Formatywny egzamin próbny składający się z 112 wielokrotnego wyboru pytań opartych na przypadkach, napisanych przez starszych studentów medycyny przy użyciu konwencjonalnych metod tworzenia pytań zgodnych z tymi samymi celami nauczania kursu.

Co mierzy badanie?

Podstawowe miary wyniku

Miara wyniku
Opis środka
Ramy czasowe
Wyniki studentów na egzaminie próbnym
Ramy czasowe: Natychmiast po zakończeniu badania próbnego
Porównanie średnich wyników egzaminów między studentami losowo przydzielonymi do egzaminów próbnych generowanych przez AI a generowanych przez ludzi.
Natychmiast po zakończeniu badania próbnego

Miary wyników drugorzędnych

Miara wyniku
Opis środka
Ramy czasowe
Wskaźnik dyskryminacji pozycji testowej
Ramy czasowe: Natychmiast po zakończeniu egzaminu próbnego
Wskaźnik dyskryminacji na poziomie pozycji porównujący pytania wielokrotnego wyboru generowane przez sztuczną inteligencję i generowane przez ludzi, reprezentujący różnicę w odsetku poprawnych odpowiedzi między studentami osiągającymi wysokie i niskie wyniki.
Natychmiast po zakończeniu egzaminu próbnego
Efektywność dystraktorów
Ramy czasowe: Natychmiast po zakończeniu badania próbnego
Proporcja dystraktorów wybranych przez co najmniej 5% uczestników, porównując pytania generowane przez sztuczną inteligencję i pytania generowane przez ludzi.
Natychmiast po zakończeniu badania próbnego
Jakość i akceptowalność egzaminów ocenianych przez studentów
Ramy czasowe: Natychmiast po zakończeniu egzaminu próbnego
Oceny studentów dotyczące trudności egzaminu, przejrzystości, trafności w odniesieniu do materiału kursu, adekwatności czasu, jakości pytań wielokrotnego wyboru, zrozumienia koncepcji klinicznych, identyfikacji luk w wiedzy, zapamiętywania na potrzeby przyszłej praktyki klinicznej oraz przygotowania do nadchodzącego egzaminu sumatywnego, mierzone bezpośrednio po zakończeniu egzaminu przy użyciu 10-punktowych skal Likerta (1 = najniższa ocena, 10 = najwyższa ocena). W przypadku większości dziedzin wyższe wyniki wskazują na większe poparcie dla mierzonej konstrukcji; w przypadku pozycji dotyczącej trudności wyższe wyniki wskazują na większą postrzeganą trudność.
Natychmiast po zakończeniu egzaminu próbnego
Wskaźnik efektywności czasu opracowania MCQ na dopasowany cel edukacyjny
Ramy czasowe: Linia bazowa (przed testowaniem uczestnika)
Wynik mierzący efektywność tworzenia pytań wielokrotnego wyboru (MCQ) generowanych przez sztuczną inteligencję (AI) w porównaniu z tymi generowanymi przez ludzi. Współczynnik efektywności obliczono jako czas opracowania MCQ generowanych przez ludzi podzielony przez czas opracowania MCQ generowanych przez AI dla dopasowanych celów edukacyjnych.
Linia bazowa (przed testowaniem uczestnika)
Zmiana w postrzeganym przygotowaniu do egzaminu sumatywnego
Ramy czasowe: Przed i bezpośrednio po zakończeniu badania próbnego
Zmiana w samoocenie przygotowania do nadchodzącego egzaminu sumującego od pomiaru przed egzaminem do pomiaru po egzaminie, mierzona na 10-punktowej skali Likerta (1 = w ogóle nieprzygotowany; 10 = niezwykle przygotowany), przy czym wyższe wyniki wskazują na większe postrzegane przygotowanie.
Przed i bezpośrednio po zakończeniu badania próbnego

Współpracownicy i badacze

Tutaj znajdziesz osoby i organizacje zaangażowane w to badanie.

Śledczy

  • Główny śledczy: Anita Palepu, MD, MPH, FRCPC, University of British Columbia

Daty zapisu na studia

Daty te śledzą postęp w przesyłaniu rekordów badań i podsumowań wyników do ClinicalTrials.gov. Zapisy badań i zgłoszone wyniki są przeglądane przez National Library of Medicine (NLM), aby upewnić się, że spełniają określone standardy kontroli jakości, zanim zostaną opublikowane na publicznej stronie internetowej.

Główne daty studiów

Rozpoczęcie studiów (Rzeczywisty)

8 grudnia 2024

Zakończenie podstawowe (Rzeczywisty)

9 grudnia 2024

Ukończenie studiów (Rzeczywisty)

9 grudnia 2024

Daty rejestracji na studia

Pierwszy przesłany

7 marca 2026

Pierwszy przesłany, który spełnia kryteria kontroli jakości

16 marca 2026

Pierwszy wysłany (Rzeczywisty)

18 marca 2026

Aktualizacje rekordów badań

Ostatnia wysłana aktualizacja (Rzeczywisty)

18 marca 2026

Ostatnia przesłana aktualizacja, która spełniała kryteria kontroli jakości

16 marca 2026

Ostatnia weryfikacja

1 marca 2026

Więcej informacji

Terminy związane z tym badaniem

Inne numery identyfikacyjne badania

  • Med_AHEAD_Trial
  • H16-00044 (Inny identyfikator: University of British Columbia)

Plan dla danych uczestnika indywidualnego (IPD)

Planujesz udostępniać dane poszczególnych uczestników (IPD)?

TAK

Opis planu IPD

Zanonimizowane wyniki badań i odpowiedzi z ankiet na poziomie uczestników będą dostępne na uzasadnioną prośbę.

Ramy czasowe udostępniania IPD

Począwszy od 6 miesięcy po publikacji, kończąc 5 lat po publikacji.

Kryteria dostępu do udostępniania IPD

Dane będą udostępniane badaczom, którzy przedstawią metodologicznie poprawny wniosek. Wnioski należy kierować do autora korespondencyjnego.

Typ informacji pomocniczych dotyczących udostępniania IPD

  • PROTOKÓŁ BADANIA
  • SOK ROŚLINNY
  • ICF
  • CSR

Informacje o lekach i urządzeniach, dokumenty badawcze

Bada produkt leczniczy regulowany przez amerykańską FDA

Nie

Bada produkt urządzenia regulowany przez amerykańską FDA

Nie

Te informacje zostały pobrane bezpośrednio ze strony internetowej clinicaltrials.gov bez żadnych zmian. Jeśli chcesz zmienić, usunąć lub zaktualizować dane swojego badania, skontaktuj się z register@clinicaltrials.gov. Gdy tylko zmiana zostanie wprowadzona na stronie clinicaltrials.gov, zostanie ona automatycznie zaktualizowana również na naszej stronie internetowej .

Subskrybuj