Benchmarking Large Language Models Against Tumour Boards for Oncology Treatment Recommendations (BEACON)
Benchmarking AI for Clinical Oncology decisioNmaking (BEACON): A Prospective, Multicentre, Blinded Evaluation of Frontier Large Language Models Against Multidisciplinary Tumour Board Recommendations in Oncology Treatment Planning
Panoramica dello studio
Stato
Stato
Condizioni
Condizioni
- Neoplasie renali
- Neoplasie urologiche
- Neoplasie dell'apparato digerente
- Neoplasie mammarie
- Neoplasie polmonari
- Neoplasie prostatiche
- Neoplasie della vescica urinaria
- Sistemi di supporto alle decisioni, clinici
- Il processo decisionale
- Neoplasie genitali
- Intelligenza Artificiale
- Modelli di linguaggio di grandi dimensioni
Intervento / Trattamento
Intervento / Trattamento
Descrizione dettagliata
BEACON is a prospective, multicentre, blinded benchmark using automated, criteria-based scoring. It is built on three design decisions that distinguish it from the existing literature: (i) synthetic, standardised cases remove the record-completeness variability that confounds retrospective comparisons and allow the identical input to be given to every board and every model; (ii) two independent tumour boards per localisation let human-human agreement be measured rather than assumed; and (iii) a guideline matrix, locked a priori, provides an objective anchor applied identically to human and model recommendations.
Reference standard. For each case-domain, a guideline matrix (guideline-recommended / acceptable / unsupported options per case-domain; ESMO, NCCN), locked and time-stamped before data collection, is applied identically to boards and models.
Five decision domains. Every recommendation is decomposed into D1 Intent, D2 Surgery, D3 Radiotherapy, D4 Systemic therapy (class + line), and D5 Work-up & biomarkers before any comparison.
Tipo di studio
Tipo di studio
Iscrizione (Stimato)
Iscrizione
Contatti e Sedi
Contatto studio
Contatto studio
- Nome: Jérôme Lambert, MD PhD
- Numero di telefono: +33 0142499742
- Email: jerome.lambert@u-paris.fr
Backup dei contatti dello studio
- Nome: Jean-Emmanuel Bibault, MD PhD
- Numero di telefono: +33 01 56 09 34 06
- Email: jean-emmanuel.bibault@aphp.fr
Luoghi di studio
-
-
-
Paris, Francia
- Reclutamento
- Hôpital Europeén Georges Pompidou
-
Contatto:
- Jean-Emmanuel Bibault, MD PhD
- Numero di telefono: +33 01 56 09 28 34
- Email: jean-emmanuel.bibault@aphp.fr
-
-
Criteri di partecipazione
Criteri di ammissibilità
Criteri di ammissibilità
Età idonea allo studio
- Adulto
- Adulto più anziano
Accetta volontari sani
Metodo di campionamento
Popolazione di studio
Descrizione
Inclusion Criteria:
- Synthetic oncology case within one of the five predefined localisations (breast, lung, urological, digestive, gynaecological).
- Complete structured schema: UICC 8th-edition stage, biomarkers, ECOG performance status, comorbidities and a standardised clinical question.
- A clinically answerable treatment-planning question that is mappable to the locked guideline matrix.
Exclusion Criteria:
- Case outside the five predefined localisations.
- Incomplete, internally inconsistent or ambiguous schema.
- Duplicate or near-duplicate of an existing case in the set.
- Question not resolvable by current guidelines.
Piano di studio
Come è strutturato lo studio?
Dettagli di progettazione
Numero di gruppi/coorti
Coorti e interventi
Gruppo / CoorteGruppo / Coorte |
Intervento / TrattamentoIntervento / Trattamento |
|---|---|
|
Breast cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Lung cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Urological cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Digestive cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Gynaecological cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
Cosa sta misurando lo studio?
Misure di risultato primarie
Misure di risultato primarie
Misura del risultato |
Misura Descrizione |
Lasso di tempo |
|---|---|---|
|
Domain-level performance between LLM recommendations and the locked guidelines.
Lasso di tempo: Assessed once at central scoring, after data collection (~October 2026)
|
For each recommendation domain and each LLM, proportion of LLM recommendation concordant with locked guidelines
|
Assessed once at central scoring, after data collection (~October 2026)
|
Misure di risultato secondarie
Misure di risultato secondarie
Misura del risultato |
Misura Descrizione |
Lasso di tempo |
|---|---|---|
|
Proportion of recommendations carrying serious harm potential ( LLM and tumour boards)
Lasso di tempo: Up to October 2026
|
Up to October 2026
|
|
|
Domain-level recommendation concordance between LLM and tumour-boards
Lasso di tempo: Up to October 2026
|
Each recommendation domain, decomposed into the five decision domains and scored per domain on an ordinal scale (2 = complete concordance; 1 = partial concordance; 0 = discordance).
|
Up to October 2026
|
|
Inter-tumour board domain-level recommendation concordance
Lasso di tempo: Up to October 2026
|
Agreement between the two independent tumour boards scored per recommendation domain
|
Up to October 2026
|
|
Equipoise rate
Lasso di tempo: Up to October 2026
|
Proportion of case-domains where the two tumour boards give different categorical recommendations
|
Up to October 2026
|
|
Completeness
Lasso di tempo: Up to October 2026
|
Proportion of required domains addressed (LLM and tumour boards)
|
Up to October 2026
|
|
Missingness
Lasso di tempo: Up to October 2026
|
Proportion of critical omissions (LLM and tumour boards)
|
Up to October 2026
|
|
Intensity bias
Lasso di tempo: Up to October 2026
|
Proportion of recommendation corresponding to over- or under-treatment
|
Up to October 2026
|
Collaboratori e investigatori
Sponsor
Sponsor
Studiare le date dei record
Studia le date principali
Inizio studio (Effettivo)
Inizio studio
Completamento primario (Stimato)
Completamento primario
Completamento dello studio (Stimato)
Completamento dello studio
Date di iscrizione allo studio
Primo inviato
Primo inviato
Primo inviato che soddisfa i criteri di controllo qualità
Primo inviato che soddisfa i criteri di controllo qualità
Primo Inserito (Effettivo)
Primo Inserito
Aggiornamenti dei record di studio
Ultimo aggiornamento pubblicato (Effettivo)
Ultimo aggiornamento pubblicato
Ultimo aggiornamento inviato che soddisfa i criteri QC
Ultimo aggiornamento inviato che soddisfa i criteri QC
Ultimo verificato
Ultimo verificato
Maggiori informazioni
Termini relativi a questo studio
Parole chiave
- Neoplasie
- La sicurezza del paziente
- Intelligenza artificiale
- Concordanza
- Sistemi di supporto alle decisioni, clinici
- Team di cura del paziente
- Riproducibilità
- Analisi comparativa
- Modelli linguistici di grandi dimensioni
- Benchmark
- Clinical Decision support
- Multidisciplinary tumour board (RCP)
- Medical oncology
- Weighted kappa
- Synthetic data
Termini MeSH pertinenti aggiuntivi
- Malattie urogenitali
- Malattie genitali
- Neoplasie genitali, maschio
- Neoplasie urogenitali
- Neoplasie per sede
- Malattie genitali, maschio
- Malattie della prostata
- Malattie urogenitali maschili
- Malattie renali
- Malattie urologiche
- Malattie urogenitali femminili
- Malattie urogenitali femminili e complicanze della gravidanza
- Malattie delle vie respiratorie
- Malattie dell'apparato digerente
- Malattie polmonari
- Neoplasie delle vie respiratorie
- Neoplasie toraciche
- Malattie della pelle
- Malattie del seno
- Malattie della vescica urinaria
- Malattie della pelle e del tessuto connettivo
- Neoplasie
- Neoplasie prostatiche
- Neoplasie polmonari
- Neoplasie mammarie
- Neoplasie della vescica urinaria
- Neoplasie urologiche
- Neoplasie renali
- Neoplasie dell'apparato digerente
Altri numeri di identificazione dello studio
Altri numeri di identificazione dello studio
- APHP261032
Piano per i dati dei singoli partecipanti (IPD)
Hai intenzione di condividere i dati dei singoli partecipanti (IPD)?
Informazioni su farmaci e dispositivi, documenti di studio
Studia un prodotto farmaceutico regolamentato dalla FDA degli Stati Uniti
Studia un dispositivo regolamentato dalla FDA degli Stati Uniti
Queste informazioni sono state recuperate direttamente dal sito web clinicaltrials.gov senza alcuna modifica. In caso di richieste di modifica, rimozione o aggiornamento dei dettagli dello studio, contattare register@clinicaltrials.gov. Non appena verrà implementata una modifica su clinicaltrials.gov, questa verrà aggiornata automaticamente anche sul nostro sito web .