Diese Seite wurde automatisch übersetzt und die Genauigkeit der Übersetzung wird nicht garantiert. Bitte wende dich an die englische Version für einen Quelltext.

AI vs Human Exam Assessment and Development (AHEAD Trial) (AHEAD)

16. März 2026 aktualisiert von: Anita Palepu, University of British Columbia

Psychometrische Leistung und studentische Wahrnehmungen von KI- versus menschlich generierten Multiple-Choice-Fragenerstellungen in der medizinischen Ausbildung: Die AHEAD randomisierte kontrollierte Studie

Die Artificial Intelligence (AI) vs Human Exam Assessment and Development (AHEAD)-Studie ist eine teilnehmerverblindete randomisierte kontrollierte Studie, die unter Erstsemester-Medizinstudierenden an der University of British Columbia durchgeführt wurde. Die Studie bewertet, ob Multiple-Choice-Prüfungsfragen, die mit großen Sprachmodellen (LLMs) generiert wurden, in der medizinischen Ausbildung vergleichbar mit traditionell von Menschen verfassten Fragen abschneiden.

Die Teilnehmer wurden randomisiert, um eine von zwei Versionen einer formativen Mock-Abschlussprüfung zu absolvieren, die aus 112 fallbasierten Single-Best-Answer-Multiple-Choice-Fragen (MCQs) bestand, die mit denselben Kurslernzielen abgestimmt waren. Eine Prüfungsversion enthielt KI-generierte Fragen, die mit einem strukturierten LLM-Workflow und unabhängiger KI-Verifikation erstellt wurden, während die andere Fragen enthielt, die von fortgeschrittenen Medizinstudenten mit konventionellen Methoden verfasst wurden.

Die Studie bewertet die Durchführbarkeit der Prüfung, die psychometrische Zuverlässigkeit, Validität, die Akzeptanz der Studierenden und die pädagogische Wirkung. Zu den Ergebnissen gehören die Prüfungsleistung, Item-Diskriminierungsindizes, die Effizienz von Distraktoren, die Wahrnehmung der Prüfungsqualität und -schwierigkeit durch die Studierenden sowie Veränderungen in der wahrgenommenen Vorbereitung auf die bevorstehende summative Prüfung.

Studienübersicht

Detaillierte Beschreibung

Die AHEAD-Studie (AI vs Human Exam Assessment and Development) ist eine randomisierte, kontrollierte Studie mit einfachem Studienzentrum und verblindeten Teilnehmern, die unter Studierenden des ersten Jahres des Doctor of Medicine (MD)-Programms durchgeführt wurde, die im Kurs Foundations of Medical Practice I (MEDD 411) an der University of British Columbia eingeschrieben waren.

Die Teilnehmer wurden im Verhältnis 1:1 randomisiert, um entweder eine KI-generierte oder eine von Menschen erstellte simulierte Abschlussprüfung zu absolvieren. Beide Prüfungen bestanden aus 112 fallbasierten Multiple-Choice-Fragen (MCQs) mit Einzelantwortauswahl, die mit denselben MEDD 411 Lehrplanzielen übereinstimmten.

Die KI-generierten Fragen wurden mit einem strukturierten Arbeitsablauf erstellt, der ChatGPT für die Fragenerstellung und Google Gemini für die unabhängige Überprüfung umfasste. Die von Menschen erstellten Fragen wurden von fortgeschrittenen Medizinstudierenden ohne KI-Unterstützung verfasst und unterzogen sich einer unabhängigen Peer-Review. Beide Prüfungen folgten identischen Formatierungsrichtlinien und bewerteten dieselben Lernziele.

Alle Teilnehmer absolvierten identische Vor- und Nachprüfungsbefragungen, die demografische Merkmale, Vertrautheit mit künstlicher Intelligenz in der Bildung und Wahrnehmungen der Prüfungserfahrung erfassten. Die Studie bewertet den Nutzen von KI-generierten Bewertungen unter Verwendung des Assessment Utility Framework von van der Vleuten, einschließlich Durchführbarkeit, Zuverlässigkeit, Validität, Akzeptanz und pädagogischer Wirkung.

Die Studie zielt darauf ab, festzustellen, ob große Sprachmodelle die Entwicklung formativer medizinischer Prüfungen beschleunigen können, während sie eine vergleichbare psychometrische Qualität und pädagogischen Wert im Vergleich zu traditionellen, von Menschen verfassten Fragen beibehalten.

Studientyp

Interventionell

Einschreibung (Tatsächlich)

258

Phase

  • Unzutreffend

Kontakte und Standorte

Dieser Abschnitt enthält die Kontaktdaten derjenigen, die die Studie durchführen, und Informationen darüber, wo diese Studie durchgeführt wird.

Studienorte

    • British Columbia
      • Vancouver, British Columbia, Kanada, V5Z 1M9
        • University of British Columbia Faculty of Medicine

Teilnahmekriterien

Forscher suchen nach Personen, die einer bestimmten Beschreibung entsprechen, die als Auswahlkriterien bezeichnet werden. Einige Beispiele für diese Kriterien sind der allgemeine Gesundheitszustand einer Person oder frühere Behandlungen.

Zulassungskriterien

Studienberechtigtes Alter

  • Erwachsene
  • Älterer Erwachsener

Akzeptiert gesunde Freiwillige

Ja

Beschreibung

Einschlusskriterien:

  • Eingeschriebene Medizinstudenten im ersten Jahr des MD-Studiengangs an der University of British Columbia.
  • Können freiwillig der Teilnahme an der formativen Prüfungssimulation zustimmen.

Ausschlusskriterien:

  • Studenten, die die Teilnahme abgelehnt haben.
  • Studenten, die die Prüfungssimulation oder erforderliche Umfragen nicht abgeschlossen haben.

Studienplan

Dieser Abschnitt enthält Einzelheiten zum Studienplan, einschließlich des Studiendesigns und der Messung der Studieninhalte.

Wie ist die Studie aufgebaut?

Designdetails

  • Hauptzweck: Sonstiges
  • Zuteilung: Zufällig
  • Interventionsmodell: Parallele Zuordnung
  • Maskierung: Single

Waffen und Interventionen

Teilnehmergruppe / Arm
Intervention / Behandlung
Experimental: KI-generierte Multiple-Choice-Prüfung
Die Teilnehmer absolvierten eine fallbasierte, aus 112 Einzelaufgaben bestehende Simulationsprüfung mit Einfachauswahlfragen, die aus KI-generierten Multiple-Choice-Fragen zusammengesetzt war. Die Fragen wurden mithilfe eines strukturierten Workflows mit großen Sprachmodellen generiert, wobei ChatGPT-4 für die Generierung und Google Gemini für die unabhängige Validierung eingesetzt wurden.
Eine formative Probeprüfung bestehend aus 112 fallbasierten Multiple-Choice-Fragen, die mit großen Sprachmodellen erstellt wurden und mit den Kurslernzielen abgestimmt sind.
Aktiver Komparator: Menschlich erstellte MCQ-Prüfung
Die Teilnehmer absolvierten eine 112-Punkte, fallbasierte, fiktive Prüfung mit Single-Best-Answer-Fragen, die aus von Menschen verfassten Multiple-Choice-Fragen bestand und von fortgeschrittenen Medizinstudenten unter Verwendung traditioneller Item-Erstellungsmethoden und Peer-Review entwickelt wurde.
Eine formative Probeprüfung, bestehend aus 112 fallbasierten Multiple-Choice-Fragen, die von fortgeschrittenen Medizinstudenten unter Verwendung konventioneller Item-Erstellungsmethoden verfasst wurden, die mit denselben Kurslernzielen abgestimmt sind.

Was misst die Studie?

Primäre Ergebnismessungen

Ergebnis Maßnahme
Maßnahmenbeschreibung
Zeitfenster
Leistung der Studenten bei der Probeprüfung
Zeitfenster: Unmittelbar nach Abschluss der Simulationsprüfung
Vergleich der durchschnittlichen Prüfungsergebnisse zwischen Studierenden, die randomisiert den KI-generierten versus den von Menschen erstellten Übungsprüfungen zugeteilt wurden.
Unmittelbar nach Abschluss der Simulationsprüfung

Sekundäre Ergebnismessungen

Ergebnis Maßnahme
Maßnahmenbeschreibung
Zeitfenster
Item-Diskriminierungsindex
Zeitfenster: Unmittelbar nach Abschluss der Prüfungssimulation
Item-bezogener Diskriminierungsindex, der KI-generierte und menschengenerierte Multiple-Choice-Fragen vergleicht, der den Unterschied im Anteil korrekter Antworten zwischen leistungsstarken und leistungsschwachen Studierenden darstellt.
Unmittelbar nach Abschluss der Prüfungssimulation
Ablenker-Effizienz
Zeitfenster: Unmittelbar nach dem Abschluss der Probeuntersuchung
Anteil der Ablenker, die von mindestens 5 % der Teilnehmer ausgewählt wurden, im Vergleich zwischen KI-generierten und menschengenerierten Fragen.
Unmittelbar nach dem Abschluss der Probeuntersuchung
Von Studenten bewertete Prüfungsqualität und Akzeptanz
Zeitfenster: Unmittelbar nach Abschluss der Simulationsprüfung
Studentenbewertungen der Prüfungsschwierigkeit, Klarheit, Relevanz für den Kursinhalt, Angemessenheit der Zeit, Qualität der Multiple-Choice-Fragen, Verständnis klinischer Konzepte, Identifizierung von Wissenslücken, Behaltensleistung für die zukünftige klinische Praxis und Vorbereitung auf die bevorstehende summative Prüfung, unmittelbar nach Prüfungsabschluss mittels 10-Punkte-Likert-Skalen gemessen (1 = niedrigste Bewertung, 10 = höchste Bewertung). Für die meisten Bereiche deuten höhere Werte auf eine stärkere Zustimmung zum gemessenen Konstrukt hin; für den Schwierigkeitspunkt deuten höhere Werte auf eine höhere wahrgenommene Schwierigkeit hin.
Unmittelbar nach Abschluss der Simulationsprüfung
Effizienzverhältnis der MCQ-Entwicklungszeit pro abgestimmten Lernziel
Zeitfenster: Ausgangswert (vor der Teilnehmeruntersuchung)
Das Ergebnis misst die Entwicklungseffizienz von künstlicher Intelligenz (KI)-generierten im Vergleich zu menschlich generierten Multiple-Choice-Fragen (MCQs). Das Effizienzverhältnis wurde als menschlich generierte MCQ-Entwicklungszeit geteilt durch KI-generierte MCQ-Entwicklungszeit für übereinstimmende Lernziele berechnet.
Ausgangswert (vor der Teilnehmeruntersuchung)
Veränderung der wahrgenommenen Vorbereitung auf die summativische Prüfung
Zeitfenster: Vor und unmittelbar nach Abschluss der simulierten Prüfung
Veränderung von der Vorprüfungs- zur Nachprüfungsphase in der selbst eingeschätzten Vorbereitung auf die bevorstehende summative Prüfung, gemessen auf einer 10-Punkte-Likert-Skala (1 = überhaupt nicht vorbereitet; 10 = äußerst gut vorbereitet), wobei höhere Werte eine größere wahrgenommene Vorbereitung anzeigen.
Vor und unmittelbar nach Abschluss der simulierten Prüfung

Mitarbeiter und Ermittler

Hier finden Sie Personen und Organisationen, die an dieser Studie beteiligt sind.

Ermittler

  • Hauptermittler: Anita Palepu, MD, MPH, FRCPC, University of British Columbia

Studienaufzeichnungsdaten

Diese Daten verfolgen den Fortschritt der Übermittlung von Studienaufzeichnungen und zusammenfassenden Ergebnissen an ClinicalTrials.gov. Studienaufzeichnungen und gemeldete Ergebnisse werden von der National Library of Medicine (NLM) überprüft, um sicherzustellen, dass sie bestimmten Qualitätskontrollstandards entsprechen, bevor sie auf der öffentlichen Website veröffentlicht werden.

Haupttermine studieren

Studienbeginn (Tatsächlich)

8. Dezember 2024

Primärer Abschluss (Tatsächlich)

9. Dezember 2024

Studienabschluss (Tatsächlich)

9. Dezember 2024

Studienanmeldedaten

Zuerst eingereicht

7. März 2026

Zuerst eingereicht, das die QC-Kriterien erfüllt hat

16. März 2026

Zuerst gepostet (Tatsächlich)

18. März 2026

Studienaufzeichnungsaktualisierungen

Letztes Update gepostet (Tatsächlich)

18. März 2026

Letztes eingereichtes Update, das die QC-Kriterien erfüllt

16. März 2026

Zuletzt verifiziert

1. März 2026

Mehr Informationen

Begriffe im Zusammenhang mit dieser Studie

Andere Studien-ID-Nummern

  • Med_AHEAD_Trial
  • H16-00044 (Andere Kennung: University of British Columbia)

Plan für individuelle Teilnehmerdaten (IPD)

Planen Sie, individuelle Teilnehmerdaten (IPD) zu teilen?

JA

Beschreibung des IPD-Plans

Die anonymisierten Untersuchungsergebnisse und Umfrageantworten auf Teilnehmerebene werden auf angemessene Anfrage hin verfügbar sein.

IPD-Sharing-Zeitrahmen

Beginnend 6 Monate nach Veröffentlichung und endend 5 Jahre nach Veröffentlichung.

IPD-Sharing-Zugriffskriterien

Daten werden mit Forschern geteilt, die einen methodisch fundierten Vorschlag vorlegen. Anfragen sollten an den entsprechenden Autor gerichtet werden.

Art der unterstützenden IPD-Freigabeinformationen

  • STUDIENPROTOKOLL
  • SAFT
  • ICF
  • CSR

Arzneimittel- und Geräteinformationen, Studienunterlagen

Studiert ein von der US-amerikanischen FDA reguliertes Arzneimittelprodukt

Nein

Studiert ein von der US-amerikanischen FDA reguliertes Geräteprodukt

Nein

Diese Informationen wurden ohne Änderungen direkt von der Website clinicaltrials.gov abgerufen. Wenn Sie Ihre Studiendaten ändern, entfernen oder aktualisieren möchten, wenden Sie sich bitte an register@clinicaltrials.gov. Sobald eine Änderung auf clinicaltrials.gov implementiert wird, wird diese automatisch auch auf unserer Website aktualisiert .

Abonnieren