- ICH GCP
- Registro degli studi clinici negli Stati Uniti
- Sperimentazione clinica NCT07481162
Valutazione e Sviluppo degli Esami: IA vs Umano (Studio AHEAD) (AHEAD)
Prestazione Psicometrica e Percezioni degli Studenti sullo Sviluppo di Domande a Scelta Multipla Generate dall'IA rispetto a Quelle Umane nell'Educazione Medica: Lo Studio Randomizzato Controllato AHEAD
Il trial AHEAD (Artificial Intelligence vs Human Exam Assessment and Development) è uno studio randomizzato controllato in cieco per i partecipanti condotto tra gli studenti di medicina del primo anno dell'Università della British Columbia. Lo studio valuta se le domande a scelta multipla generate utilizzando modelli linguistici di grandi dimensioni (LLM) performano in modo comparabile alle domande tradizionalmente scritte da esseri umani nell'educazione medica.
I partecipanti sono stati randomizzati per completare una delle due versioni di un esame finale formativo simulato, composto da 112 domande a scelta multipla a risposta singola migliore (MCQ) basate su casi clinici, allineate con gli stessi obiettivi di apprendimento del corso. Una versione dell'esame conteneva domande generate dall'IA prodotte utilizzando un flusso di lavoro strutturato con LLM con verifica indipendente dell'IA, mentre l'altra conteneva domande redatte da studenti di medicina senior utilizzando metodi convenzionali.
Lo studio valuta la fattibilità dell'esame, l'affidabilità psicometrica, la validità, l'accettabilità da parte degli studenti e l'impatto educativo. Gli esiti includono la performance all'esame, gli indici di discriminazione degli item, l'efficienza dei distrattori, le percezioni degli studenti sulla qualità e difficoltà dell'esame, e i cambiamenti nella percezione di preparazione per il prossimo esame sommativo.
Panoramica dello studio
Stato
Condizioni
Intervento / Trattamento
Descrizione dettagliata
Lo studio AHEAD (Valutazione e Sviluppo dell'Esame: Intelligenza Artificiale vs Umana) è uno studio randomizzato controllato in singolo centro, con partecipanti in cieco, condotto tra gli studenti del primo anno del corso di Laurea in Medicina (MD) iscritti al corso Fondamenti della Pratica Medica I (MEDD 411) presso l'Università della British Columbia.
I partecipanti sono stati randomizzati in rapporto 1:1 per completare un esame simulato finale generato dall'intelligenza artificiale o uno generato da esseri umani. Entrambi gli esami consistevano in 112 domande a risposta multipla a scelta singola basate su casi clinici, allineate agli stessi obiettivi curriculari del MEDD 411.
Le domande generate dall'intelligenza artificiale sono state prodotte utilizzando un flusso di lavoro strutturato che coinvolgeva ChatGPT per la generazione delle domande e Google Gemini per la verifica indipendente. Le domande generate da esseri umani sono state redatte da studenti di medicina senior senza assistenza dell'intelligenza artificiale e hanno subito una revisione tra pari indipendente. Entrambi gli esami hanno seguito linee guida di formattazione identiche e hanno valutato gli stessi obiettivi di apprendimento.
Tutti i partecipanti hanno completato sondaggi identici pre-esame e post-esame per valutare le caratteristiche demografiche, la familiarità con l'intelligenza artificiale nell'istruzione e le percezioni dell'esperienza d'esame. Lo studio valuta l'utilità delle valutazioni generate dall'intelligenza artificiale utilizzando il Framework di Utilità della Valutazione di van der Vleuten, includendo fattibilità, affidabilità, validità, accettabilità e impatto educativo.
Lo studio mira a determinare se i modelli linguistici di grandi dimensioni possono accelerare lo sviluppo di esami medici formativi mantenendo una qualità psicometrica e un valore educativo comparabili rispetto alle domande tradizionali redatte da esseri umani.
Tipo di studio
Iscrizione (Effettivo)
Fase
- Non applicabile
Contatti e Sedi
Luoghi di studio
-
-
British Columbia
-
Vancouver, British Columbia, Canada, V5Z 1M9
- University of British Columbia Faculty of Medicine
-
-
Criteri di partecipazione
Criteri di ammissibilità
Età idonea allo studio
- Adulto
- Adulto più anziano
Accetta volontari sani
Descrizione
Criteri di inclusione:
- Studenti di medicina del primo anno iscritti al programma universitario MD della University of British Columbia.
- Possono dare volontariamente il consenso a partecipare allo studio formativo dell'esame simulato.
Criteri di esclusione:
- Studenti che hanno rifiutato la partecipazione.
- Studenti che non hanno completato l'esame simulato o i sondaggi richiesti.
Piano di studio
Come è strutturato lo studio?
Dettagli di progettazione
- Scopo principale: Altro
- Assegnazione: Randomizzato
- Modello interventistico: Assegnazione parallela
- Mascheramento: Separare
Armi e interventi
Gruppo di partecipanti / Arm |
Intervento / Trattamento |
|---|---|
|
Sperimentale: Esame a Scelta Multipla Generato dall'IA
I partecipanti hanno completato un esame simulato di 112 domande a scelta multipla basato su casi clinici, composto da domande generate dall'IA.
Le domande sono state generate utilizzando un flusso di lavoro strutturato con modelli linguistici di grandi dimensioni, con ChatGPT-4 per la generazione e Google Gemini per la validazione indipendente.
|
Un esame simulativo formativo composto da 112 domande a scelta multipla basate su casi clinici, generate utilizzando modelli linguistici di grandi dimensioni allineati con gli obiettivi di apprendimento del corso.
|
|
Comparatore attivo: Esame MCQ Generato dall'Uomo
I partecipanti hanno completato un esame simulato composto da 112 item a risposta singola ottimale basato su casi, formato da domande a scelta multipla redatte da studenti di medicina senior utilizzando metodi tradizionali di scrittura degli item e revisione tra pari.
|
Un esame simulativo formativo composto da 112 domande a scelta multipla basate su casi clinici, redatte da studenti di medicina senior utilizzando metodi convenzionali di formulazione degli item, allineati con gli stessi obiettivi di apprendimento del corso.
|
Cosa sta misurando lo studio?
Misure di risultato primarie
Misura del risultato |
Misura Descrizione |
Lasso di tempo |
|---|---|---|
|
Prestazione dello studente nell'esame di prova
Lasso di tempo: Immediatamente dopo il completamento dell'esame fittizio
|
Confronto dei punteggi medi degli esami tra studenti randomizzati alle simulazioni d'esame generate dall'IA rispetto a quelle generate da umani.
|
Immediatamente dopo il completamento dell'esame fittizio
|
Misure di risultato secondarie
Misura del risultato |
Misura Descrizione |
Lasso di tempo |
|---|---|---|
|
Indice di discriminazione dell'item
Lasso di tempo: Immediatamente dopo il completamento dell'esame simulato
|
Indice di discriminazione a livello di item che confronta domande a scelta multipla generate dall'intelligenza artificiale e da esseri umani, rappresentando la differenza nella proporzione di risposte corrette tra studenti ad alte prestazioni e studenti a basse prestazioni.
|
Immediatamente dopo il completamento dell'esame simulato
|
|
Efficienza del distrattore
Lasso di tempo: Immediatamente dopo il completamento dell'esame simulato
|
Proporzione di distrattori selezionati da almeno il 5% dei partecipanti, confrontando domande generate dall'IA e domande generate da esseri umani.
|
Immediatamente dopo il completamento dell'esame simulato
|
|
Qualità ed accettabilità dell'esame valutata dagli studenti
Lasso di tempo: Immediatamente dopo il completamento dell'esame simulato
|
Valutazioni degli studenti sulla difficoltà dell'esame, chiarezza, pertinenza rispetto al materiale del corso, adeguatezza del tempo, qualità delle domande a scelta multipla, comprensione dei concetti clinici, identificazione delle lacune di conoscenza, conservazione per la futura pratica clinica e preparazione per il prossimo esame sommativo, misurate immediatamente dopo il completamento dell'esame utilizzando scale Likert a 10 punti (1 = valutazione più bassa, 10 = valutazione più alta).
Per la maggior parte dei domini, punteggi più alti indicano un maggiore sostegno del costrutto misurato; per la voce sulla difficoltà, punteggi più alti indicano una maggiore difficoltà percepita.
|
Immediatamente dopo il completamento dell'esame simulato
|
|
Rapporto di efficienza del tempo di sviluppo MCQ per obiettivo di apprendimento corrispondente
Lasso di tempo: Baseline (prima del test del partecipante)
|
L'esito che misura l'efficienza di sviluppo delle domande a scelta multipla (MCQ) generate dall'intelligenza artificiale (IA) rispetto a quelle generate dagli esseri umani.
Il rapporto di efficienza è stato calcolato come il tempo di sviluppo delle MCQ generate dagli esseri umani diviso per il tempo di sviluppo delle MCQ generate dall'IA per obiettivi di apprendimento corrispondenti.
|
Baseline (prima del test del partecipante)
|
|
Variazione nella percezione di preparazione per l'esame sommario
Lasso di tempo: Prima e immediatamente dopo il completamento dell'esame simulato
|
Variazione tra pre-esame e post-esame nella preparazione autovalutata per il prossimo esame sommativo, misurata su una scala Likert a 10 punti (1 = per niente preparato; 10 = estremamente preparato), con punteggi più alti che indicano una maggiore percezione di preparazione.
|
Prima e immediatamente dopo il completamento dell'esame simulato
|
Collaboratori e investigatori
Sponsor
Investigatori
- Investigatore principale: Anita Palepu, MD, MPH, FRCPC, University of British Columbia
Studiare le date dei record
Studia le date principali
Inizio studio (Effettivo)
Completamento primario (Effettivo)
Completamento dello studio (Effettivo)
Date di iscrizione allo studio
Primo inviato
Primo inviato che soddisfa i criteri di controllo qualità
Primo Inserito (Effettivo)
Aggiornamenti dei record di studio
Ultimo aggiornamento pubblicato (Effettivo)
Ultimo aggiornamento inviato che soddisfa i criteri QC
Ultimo verificato
Maggiori informazioni
Termini relativi a questo studio
Parole chiave
Altri numeri di identificazione dello studio
- Med_AHEAD_Trial
- H16-00044 (Altro identificatore: University of British Columbia)
Piano per i dati dei singoli partecipanti (IPD)
Hai intenzione di condividere i dati dei singoli partecipanti (IPD)?
Descrizione del piano IPD
Periodo di condivisione IPD
Criteri di accesso alla condivisione IPD
Tipo di informazioni di supporto alla condivisione IPD
- STUDIO_PROTOCOLLO
- LINFA
- ICF
- RSI
Informazioni su farmaci e dispositivi, documenti di studio
Studia un prodotto farmaceutico regolamentato dalla FDA degli Stati Uniti
Studia un dispositivo regolamentato dalla FDA degli Stati Uniti
Queste informazioni sono state recuperate direttamente dal sito web clinicaltrials.gov senza alcuna modifica. In caso di richieste di modifica, rimozione o aggiornamento dei dettagli dello studio, contattare register@clinicaltrials.gov. Non appena verrà implementata una modifica su clinicaltrials.gov, questa verrà aggiornata automaticamente anche sul nostro sito web .