- ICH GCP
- Rejestr badań klinicznych w USA
- Badanie kliniczne NCT07481162
AI kontra człowiek – ocena i rozwój egzaminów (badanie AHEAD) (AHEAD)
Psychometryczne Właściwości i Percepcje Studentów Dotyczące Tworzenia Pytań Wielokrotnego Wyboru przez AI w Porównaniu z Pytaniami Tworzonymi przez Człowieka w Edukacji Medycznej: Randomizowane Badanie Kontrolowane AHEAD
Badanie porównawcze oceny i rozwoju sztucznej inteligencji (AI) a człowieka (AHEAD) to randomizowane badanie kontrolowane z zaślepieniem uczestników przeprowadzone wśród studentów pierwszego roku medycyny na Uniwersytecie Kolumbii Brytyjskiej. Badanie ocenia, czy pytania egzaminacyjne wielokrotnego wyboru generowane przy użyciu dużych modeli językowych (LLM) sprawdzają się porównywalnie z tradycyjnymi pytaniami pisanymi przez człowieka w edukacji medycznej.
Uczestnicy zostali losowo przydzieleni do wypełnienia jednej z dwóch wersji formatywnego egzaminu próbnego końcowego, składającego się z 112 pytań wielokrotnego wyboru typu pojedyncza najlepsza odpowiedź opartych na przypadkach (MCQ), zgodnych z tymi samymi celami edukacyjnymi kursu. Jedna wersja egzaminu zawierała pytania wygenerowane przez AI przy użyciu ustrukturyzowanego przepływu pracy LLM z niezależną weryfikacją AI, podczas gdy druga zawierała pytania napisane przez starszych studentów medycyny przy użyciu konwencjonalnych metod.
Badanie ocenia wykonalność egzaminu, rzetelność psychometryczną, trafność, akceptowalność przez studentów oraz wpływ edukacyjny. Wyniki obejmują wyniki egzaminu, wskaźniki dyskryminacji pozycji, efektywność dystraktorów, postrzeganie przez studentów jakości i trudności egzaminu oraz zmiany w postrzeganym przygotowaniu do nadchodzącego egzaminu sumatywnego.
Przegląd badań
Status
Warunki
Szczegółowy opis
Badanie AHEAD (AI vs Human Exam Assessment and Development) to jednostkowe, zaślepione dla uczestników randomizowane badanie kontrolowane przeprowadzone wśród studentów pierwszego roku studiów lekarskich (MD) zapisanych na kurs Podstaw Praktyki Medycznej I (MEDD 411) na Uniwersytecie Kolumbii Brytyjskiej.
Uczestnicy zostali randomizowani w stosunku 1:1, aby wypełnić albo wygenerowany przez sztuczną inteligencję (AI), albo stworzony przez człowieka próbny egzamin końcowy. Oba egzaminy składały się z 112 pytań wielokrotnego wyboru (MCQ) typu pojedyncza najlepsza odpowiedź, opartych na przypadkach i zgodnych z tymi samymi celami programowymi MEDD 411.
Pytania wygenerowane przez AI zostały stworzone przy użyciu ustrukturyzowanego procesu obejmującego ChatGPT do generowania pytań i Google Gemini do niezależnej weryfikacji. Pytania stworzone przez człowieka zostały opracowane przez starszych studentów medycyny bez pomocy AI i przeszły niezależną recenzję koleżeńską. Oba egzaminy stosowały identyczne wytyczne formatowania i oceniały te same cele edukacyjne.
Wszyscy uczestnicy wypełnili identyczne ankiety przed i po egzaminie, oceniające cechy demograficzne, znajomość sztucznej inteligencji w edukacji oraz postrzeganie doświadczenia egzaminacyjnego. Badanie ocenia użyteczność ocen wygenerowanych przez AI przy użyciu Ram Użyteczności Oceny van der Vleutena, obejmujących wykonalność, rzetelność, trafność, akceptowalność i wpływ edukacyjny.
Badanie ma na celu ustalenie, czy duże modele językowe mogą przyspieszyć rozwój formatywnych egzaminów medycznych, przy jednoczesnym utrzymaniu porównywalnej jakości psychometrycznej i wartości edukacyjnej w stosunku do tradycyjnych pytań opracowanych przez człowieka.
Typ studiów
Zapisy (Rzeczywisty)
Faza
- Nie dotyczy
Kontakty i lokalizacje
Lokalizacje studiów
-
-
British Columbia
-
Vancouver, British Columbia, Kanada, V5Z 1M9
- University of British Columbia Faculty of Medicine
-
-
Kryteria uczestnictwa
Kryteria kwalifikacji
Wiek uprawniający do nauki
- Dorosły
- Starszy dorosły
Akceptuje zdrowych ochotników
Opis
Kryteria włączenia:
- Studenci pierwszego roku medycyny zapisani na program studiów licencjackich MD Uniwersytetu Kolumbii Brytyjskiej.
- Mogą dobrowolnie wyrazić zgodę na udział w badaniu formatywnym symulowanego egzaminu.
Kryteria wykluczenia:
- Studenci, którzy odmówili udziału.
- Studenci, którzy nie ukończyli symulowanego egzaminu lub wymaganych ankiet.
Plan studiów
Jak projektuje się badanie?
Szczegóły projektu
- Główny cel: Inny
- Przydział: Randomizowane
- Model interwencyjny: Przydział równoległy
- Maskowanie: Pojedynczy
Broń i interwencje
Grupa uczestników / Arm |
Interwencja / Leczenie |
|---|---|
|
Eksperymentalny: Egzamin z pytaniami wielokrotnego wyboru generowanymi przez sztuczną inteligencję
Uczestnicy wypełnili 112-punktowy, oparty na przypadkach, imitacyjny egzamin typu single-best-answer, składający się z wygenerowanych przez sztuczną inteligencję pytań wielokrotnego wyboru.
Pytania zostały wygenerowane przy użyciu ustrukturyzowanego procesu pracy z dużym modelem językowym z ChatGPT-4 do generowania i Google Gemini do niezależnej walidacji.
|
Formacyjny próbny egzamin składający się z 112 pytań wielokrotnego wyboru opartych na przypadkach, wygenerowanych przy użyciu dużych modeli językowych zgodnych z celami edukacyjnymi kursu.
|
|
Aktywny komparator: Egzamin z pytaniami wielokrotnego wyboru opracowany przez człowieka
Uczestnicy wypełnili 112-punktowe, oparte na przypadkach, jednoprawidłowe-odpowiedzi, próbne egzamin, złożony z opracowanych przez człowieka pytań wielokrotnego wyboru, stworzonych przez studentów medycyny ostatnich lat studiów, z wykorzystaniem tradycyjnych metod tworzenia zadań oraz recenzji koleżeńskiej.
|
Formatywny egzamin próbny składający się z 112 wielokrotnego wyboru pytań opartych na przypadkach, napisanych przez starszych studentów medycyny przy użyciu konwencjonalnych metod tworzenia pytań zgodnych z tymi samymi celami nauczania kursu.
|
Co mierzy badanie?
Podstawowe miary wyniku
Miara wyniku |
Opis środka |
Ramy czasowe |
|---|---|---|
|
Wyniki studentów na egzaminie próbnym
Ramy czasowe: Natychmiast po zakończeniu badania próbnego
|
Porównanie średnich wyników egzaminów między studentami losowo przydzielonymi do egzaminów próbnych generowanych przez AI a generowanych przez ludzi.
|
Natychmiast po zakończeniu badania próbnego
|
Miary wyników drugorzędnych
Miara wyniku |
Opis środka |
Ramy czasowe |
|---|---|---|
|
Wskaźnik dyskryminacji pozycji testowej
Ramy czasowe: Natychmiast po zakończeniu egzaminu próbnego
|
Wskaźnik dyskryminacji na poziomie pozycji porównujący pytania wielokrotnego wyboru generowane przez sztuczną inteligencję i generowane przez ludzi, reprezentujący różnicę w odsetku poprawnych odpowiedzi między studentami osiągającymi wysokie i niskie wyniki.
|
Natychmiast po zakończeniu egzaminu próbnego
|
|
Efektywność dystraktorów
Ramy czasowe: Natychmiast po zakończeniu badania próbnego
|
Proporcja dystraktorów wybranych przez co najmniej 5% uczestników, porównując pytania generowane przez sztuczną inteligencję i pytania generowane przez ludzi.
|
Natychmiast po zakończeniu badania próbnego
|
|
Jakość i akceptowalność egzaminów ocenianych przez studentów
Ramy czasowe: Natychmiast po zakończeniu egzaminu próbnego
|
Oceny studentów dotyczące trudności egzaminu, przejrzystości, trafności w odniesieniu do materiału kursu, adekwatności czasu, jakości pytań wielokrotnego wyboru, zrozumienia koncepcji klinicznych, identyfikacji luk w wiedzy, zapamiętywania na potrzeby przyszłej praktyki klinicznej oraz przygotowania do nadchodzącego egzaminu sumatywnego, mierzone bezpośrednio po zakończeniu egzaminu przy użyciu 10-punktowych skal Likerta (1 = najniższa ocena, 10 = najwyższa ocena).
W przypadku większości dziedzin wyższe wyniki wskazują na większe poparcie dla mierzonej konstrukcji; w przypadku pozycji dotyczącej trudności wyższe wyniki wskazują na większą postrzeganą trudność.
|
Natychmiast po zakończeniu egzaminu próbnego
|
|
Wskaźnik efektywności czasu opracowania MCQ na dopasowany cel edukacyjny
Ramy czasowe: Linia bazowa (przed testowaniem uczestnika)
|
Wynik mierzący efektywność tworzenia pytań wielokrotnego wyboru (MCQ) generowanych przez sztuczną inteligencję (AI) w porównaniu z tymi generowanymi przez ludzi.
Współczynnik efektywności obliczono jako czas opracowania MCQ generowanych przez ludzi podzielony przez czas opracowania MCQ generowanych przez AI dla dopasowanych celów edukacyjnych.
|
Linia bazowa (przed testowaniem uczestnika)
|
|
Zmiana w postrzeganym przygotowaniu do egzaminu sumatywnego
Ramy czasowe: Przed i bezpośrednio po zakończeniu badania próbnego
|
Zmiana w samoocenie przygotowania do nadchodzącego egzaminu sumującego od pomiaru przed egzaminem do pomiaru po egzaminie, mierzona na 10-punktowej skali Likerta (1 = w ogóle nieprzygotowany; 10 = niezwykle przygotowany), przy czym wyższe wyniki wskazują na większe postrzegane przygotowanie.
|
Przed i bezpośrednio po zakończeniu badania próbnego
|
Współpracownicy i badacze
Sponsor
Śledczy
- Główny śledczy: Anita Palepu, MD, MPH, FRCPC, University of British Columbia
Daty zapisu na studia
Główne daty studiów
Rozpoczęcie studiów (Rzeczywisty)
Zakończenie podstawowe (Rzeczywisty)
Ukończenie studiów (Rzeczywisty)
Daty rejestracji na studia
Pierwszy przesłany
Pierwszy przesłany, który spełnia kryteria kontroli jakości
Pierwszy wysłany (Rzeczywisty)
Aktualizacje rekordów badań
Ostatnia wysłana aktualizacja (Rzeczywisty)
Ostatnia przesłana aktualizacja, która spełniała kryteria kontroli jakości
Ostatnia weryfikacja
Więcej informacji
Terminy związane z tym badaniem
Słowa kluczowe
Inne numery identyfikacyjne badania
- Med_AHEAD_Trial
- H16-00044 (Inny identyfikator: University of British Columbia)
Plan dla danych uczestnika indywidualnego (IPD)
Planujesz udostępniać dane poszczególnych uczestników (IPD)?
Opis planu IPD
Ramy czasowe udostępniania IPD
Kryteria dostępu do udostępniania IPD
Typ informacji pomocniczych dotyczących udostępniania IPD
- PROTOKÓŁ BADANIA
- SOK ROŚLINNY
- ICF
- CSR
Informacje o lekach i urządzeniach, dokumenty badawcze
Bada produkt leczniczy regulowany przez amerykańską FDA
Bada produkt urządzenia regulowany przez amerykańską FDA
Te informacje zostały pobrane bezpośrednio ze strony internetowej clinicaltrials.gov bez żadnych zmian. Jeśli chcesz zmienić, usunąć lub zaktualizować dane swojego badania, skontaktuj się z register@clinicaltrials.gov. Gdy tylko zmiana zostanie wprowadzona na stronie clinicaltrials.gov, zostanie ona automatycznie zaktualizowana również na naszej stronie internetowej .