- ICH GCP
- US-Register für klinische Studien
- Klinische Studie NCT07481162
AI vs Human Exam Assessment and Development (AHEAD Trial) (AHEAD)
Psychometrische Leistung und studentische Wahrnehmungen von KI- versus menschlich generierten Multiple-Choice-Fragenerstellungen in der medizinischen Ausbildung: Die AHEAD randomisierte kontrollierte Studie
Die Artificial Intelligence (AI) vs Human Exam Assessment and Development (AHEAD)-Studie ist eine teilnehmerverblindete randomisierte kontrollierte Studie, die unter Erstsemester-Medizinstudierenden an der University of British Columbia durchgeführt wurde. Die Studie bewertet, ob Multiple-Choice-Prüfungsfragen, die mit großen Sprachmodellen (LLMs) generiert wurden, in der medizinischen Ausbildung vergleichbar mit traditionell von Menschen verfassten Fragen abschneiden.
Die Teilnehmer wurden randomisiert, um eine von zwei Versionen einer formativen Mock-Abschlussprüfung zu absolvieren, die aus 112 fallbasierten Single-Best-Answer-Multiple-Choice-Fragen (MCQs) bestand, die mit denselben Kurslernzielen abgestimmt waren. Eine Prüfungsversion enthielt KI-generierte Fragen, die mit einem strukturierten LLM-Workflow und unabhängiger KI-Verifikation erstellt wurden, während die andere Fragen enthielt, die von fortgeschrittenen Medizinstudenten mit konventionellen Methoden verfasst wurden.
Die Studie bewertet die Durchführbarkeit der Prüfung, die psychometrische Zuverlässigkeit, Validität, die Akzeptanz der Studierenden und die pädagogische Wirkung. Zu den Ergebnissen gehören die Prüfungsleistung, Item-Diskriminierungsindizes, die Effizienz von Distraktoren, die Wahrnehmung der Prüfungsqualität und -schwierigkeit durch die Studierenden sowie Veränderungen in der wahrgenommenen Vorbereitung auf die bevorstehende summative Prüfung.
Studienübersicht
Status
Bedingungen
Intervention / Behandlung
Detaillierte Beschreibung
Die AHEAD-Studie (AI vs Human Exam Assessment and Development) ist eine randomisierte, kontrollierte Studie mit einfachem Studienzentrum und verblindeten Teilnehmern, die unter Studierenden des ersten Jahres des Doctor of Medicine (MD)-Programms durchgeführt wurde, die im Kurs Foundations of Medical Practice I (MEDD 411) an der University of British Columbia eingeschrieben waren.
Die Teilnehmer wurden im Verhältnis 1:1 randomisiert, um entweder eine KI-generierte oder eine von Menschen erstellte simulierte Abschlussprüfung zu absolvieren. Beide Prüfungen bestanden aus 112 fallbasierten Multiple-Choice-Fragen (MCQs) mit Einzelantwortauswahl, die mit denselben MEDD 411 Lehrplanzielen übereinstimmten.
Die KI-generierten Fragen wurden mit einem strukturierten Arbeitsablauf erstellt, der ChatGPT für die Fragenerstellung und Google Gemini für die unabhängige Überprüfung umfasste. Die von Menschen erstellten Fragen wurden von fortgeschrittenen Medizinstudierenden ohne KI-Unterstützung verfasst und unterzogen sich einer unabhängigen Peer-Review. Beide Prüfungen folgten identischen Formatierungsrichtlinien und bewerteten dieselben Lernziele.
Alle Teilnehmer absolvierten identische Vor- und Nachprüfungsbefragungen, die demografische Merkmale, Vertrautheit mit künstlicher Intelligenz in der Bildung und Wahrnehmungen der Prüfungserfahrung erfassten. Die Studie bewertet den Nutzen von KI-generierten Bewertungen unter Verwendung des Assessment Utility Framework von van der Vleuten, einschließlich Durchführbarkeit, Zuverlässigkeit, Validität, Akzeptanz und pädagogischer Wirkung.
Die Studie zielt darauf ab, festzustellen, ob große Sprachmodelle die Entwicklung formativer medizinischer Prüfungen beschleunigen können, während sie eine vergleichbare psychometrische Qualität und pädagogischen Wert im Vergleich zu traditionellen, von Menschen verfassten Fragen beibehalten.
Studientyp
Einschreibung (Tatsächlich)
Phase
- Unzutreffend
Kontakte und Standorte
Studienorte
-
-
British Columbia
-
Vancouver, British Columbia, Kanada, V5Z 1M9
- University of British Columbia Faculty of Medicine
-
-
Teilnahmekriterien
Zulassungskriterien
Studienberechtigtes Alter
- Erwachsene
- Älterer Erwachsener
Akzeptiert gesunde Freiwillige
Beschreibung
Einschlusskriterien:
- Eingeschriebene Medizinstudenten im ersten Jahr des MD-Studiengangs an der University of British Columbia.
- Können freiwillig der Teilnahme an der formativen Prüfungssimulation zustimmen.
Ausschlusskriterien:
- Studenten, die die Teilnahme abgelehnt haben.
- Studenten, die die Prüfungssimulation oder erforderliche Umfragen nicht abgeschlossen haben.
Studienplan
Wie ist die Studie aufgebaut?
Designdetails
- Hauptzweck: Sonstiges
- Zuteilung: Zufällig
- Interventionsmodell: Parallele Zuordnung
- Maskierung: Single
Waffen und Interventionen
Teilnehmergruppe / Arm |
Intervention / Behandlung |
|---|---|
|
Experimental: KI-generierte Multiple-Choice-Prüfung
Die Teilnehmer absolvierten eine fallbasierte, aus 112 Einzelaufgaben bestehende Simulationsprüfung mit Einfachauswahlfragen, die aus KI-generierten Multiple-Choice-Fragen zusammengesetzt war.
Die Fragen wurden mithilfe eines strukturierten Workflows mit großen Sprachmodellen generiert, wobei ChatGPT-4 für die Generierung und Google Gemini für die unabhängige Validierung eingesetzt wurden.
|
Eine formative Probeprüfung bestehend aus 112 fallbasierten Multiple-Choice-Fragen, die mit großen Sprachmodellen erstellt wurden und mit den Kurslernzielen abgestimmt sind.
|
|
Aktiver Komparator: Menschlich erstellte MCQ-Prüfung
Die Teilnehmer absolvierten eine 112-Punkte, fallbasierte, fiktive Prüfung mit Single-Best-Answer-Fragen, die aus von Menschen verfassten Multiple-Choice-Fragen bestand und von fortgeschrittenen Medizinstudenten unter Verwendung traditioneller Item-Erstellungsmethoden und Peer-Review entwickelt wurde.
|
Eine formative Probeprüfung, bestehend aus 112 fallbasierten Multiple-Choice-Fragen, die von fortgeschrittenen Medizinstudenten unter Verwendung konventioneller Item-Erstellungsmethoden verfasst wurden, die mit denselben Kurslernzielen abgestimmt sind.
|
Was misst die Studie?
Primäre Ergebnismessungen
Ergebnis Maßnahme |
Maßnahmenbeschreibung |
Zeitfenster |
|---|---|---|
|
Leistung der Studenten bei der Probeprüfung
Zeitfenster: Unmittelbar nach Abschluss der Simulationsprüfung
|
Vergleich der durchschnittlichen Prüfungsergebnisse zwischen Studierenden, die randomisiert den KI-generierten versus den von Menschen erstellten Übungsprüfungen zugeteilt wurden.
|
Unmittelbar nach Abschluss der Simulationsprüfung
|
Sekundäre Ergebnismessungen
Ergebnis Maßnahme |
Maßnahmenbeschreibung |
Zeitfenster |
|---|---|---|
|
Item-Diskriminierungsindex
Zeitfenster: Unmittelbar nach Abschluss der Prüfungssimulation
|
Item-bezogener Diskriminierungsindex, der KI-generierte und menschengenerierte Multiple-Choice-Fragen vergleicht, der den Unterschied im Anteil korrekter Antworten zwischen leistungsstarken und leistungsschwachen Studierenden darstellt.
|
Unmittelbar nach Abschluss der Prüfungssimulation
|
|
Ablenker-Effizienz
Zeitfenster: Unmittelbar nach dem Abschluss der Probeuntersuchung
|
Anteil der Ablenker, die von mindestens 5 % der Teilnehmer ausgewählt wurden, im Vergleich zwischen KI-generierten und menschengenerierten Fragen.
|
Unmittelbar nach dem Abschluss der Probeuntersuchung
|
|
Von Studenten bewertete Prüfungsqualität und Akzeptanz
Zeitfenster: Unmittelbar nach Abschluss der Simulationsprüfung
|
Studentenbewertungen der Prüfungsschwierigkeit, Klarheit, Relevanz für den Kursinhalt, Angemessenheit der Zeit, Qualität der Multiple-Choice-Fragen, Verständnis klinischer Konzepte, Identifizierung von Wissenslücken, Behaltensleistung für die zukünftige klinische Praxis und Vorbereitung auf die bevorstehende summative Prüfung, unmittelbar nach Prüfungsabschluss mittels 10-Punkte-Likert-Skalen gemessen (1 = niedrigste Bewertung, 10 = höchste Bewertung).
Für die meisten Bereiche deuten höhere Werte auf eine stärkere Zustimmung zum gemessenen Konstrukt hin; für den Schwierigkeitspunkt deuten höhere Werte auf eine höhere wahrgenommene Schwierigkeit hin.
|
Unmittelbar nach Abschluss der Simulationsprüfung
|
|
Effizienzverhältnis der MCQ-Entwicklungszeit pro abgestimmten Lernziel
Zeitfenster: Ausgangswert (vor der Teilnehmeruntersuchung)
|
Das Ergebnis misst die Entwicklungseffizienz von künstlicher Intelligenz (KI)-generierten im Vergleich zu menschlich generierten Multiple-Choice-Fragen (MCQs).
Das Effizienzverhältnis wurde als menschlich generierte MCQ-Entwicklungszeit geteilt durch KI-generierte MCQ-Entwicklungszeit für übereinstimmende Lernziele berechnet.
|
Ausgangswert (vor der Teilnehmeruntersuchung)
|
|
Veränderung der wahrgenommenen Vorbereitung auf die summativische Prüfung
Zeitfenster: Vor und unmittelbar nach Abschluss der simulierten Prüfung
|
Veränderung von der Vorprüfungs- zur Nachprüfungsphase in der selbst eingeschätzten Vorbereitung auf die bevorstehende summative Prüfung, gemessen auf einer 10-Punkte-Likert-Skala (1 = überhaupt nicht vorbereitet; 10 = äußerst gut vorbereitet), wobei höhere Werte eine größere wahrgenommene Vorbereitung anzeigen.
|
Vor und unmittelbar nach Abschluss der simulierten Prüfung
|
Mitarbeiter und Ermittler
Sponsor
Ermittler
- Hauptermittler: Anita Palepu, MD, MPH, FRCPC, University of British Columbia
Studienaufzeichnungsdaten
Haupttermine studieren
Studienbeginn (Tatsächlich)
Primärer Abschluss (Tatsächlich)
Studienabschluss (Tatsächlich)
Studienanmeldedaten
Zuerst eingereicht
Zuerst eingereicht, das die QC-Kriterien erfüllt hat
Zuerst gepostet (Tatsächlich)
Studienaufzeichnungsaktualisierungen
Letztes Update gepostet (Tatsächlich)
Letztes eingereichtes Update, das die QC-Kriterien erfüllt
Zuletzt verifiziert
Mehr Informationen
Begriffe im Zusammenhang mit dieser Studie
Schlüsselwörter
Andere Studien-ID-Nummern
- Med_AHEAD_Trial
- H16-00044 (Andere Kennung: University of British Columbia)
Plan für individuelle Teilnehmerdaten (IPD)
Planen Sie, individuelle Teilnehmerdaten (IPD) zu teilen?
Beschreibung des IPD-Plans
IPD-Sharing-Zeitrahmen
IPD-Sharing-Zugriffskriterien
Art der unterstützenden IPD-Freigabeinformationen
- STUDIENPROTOKOLL
- SAFT
- ICF
- CSR
Arzneimittel- und Geräteinformationen, Studienunterlagen
Studiert ein von der US-amerikanischen FDA reguliertes Arzneimittelprodukt
Studiert ein von der US-amerikanischen FDA reguliertes Geräteprodukt
Diese Informationen wurden ohne Änderungen direkt von der Website clinicaltrials.gov abgerufen. Wenn Sie Ihre Studiendaten ändern, entfernen oder aktualisieren möchten, wenden Sie sich bitte an register@clinicaltrials.gov. Sobald eine Änderung auf clinicaltrials.gov implementiert wird, wird diese automatisch auch auf unserer Website aktualisiert .