- ICH GCP
- Registre américain des essais cliniques
- Essai clinique NCT07739121
Benchmarking Large Language Models Against Tumour Boards for Oncology Treatment Recommendations (BEACON)
Benchmarking AI for Clinical Oncology decisioNmaking (BEACON): A Prospective, Multicentre, Blinded Evaluation of Frontier Large Language Models Against Multidisciplinary Tumour Board Recommendations in Oncology Treatment Planning
Aperçu de l'étude
Statut
Les conditions
Intervention / Traitement
Description détaillée
BEACON is a prospective, multicentre, blinded benchmark using automated, criteria-based scoring. It is built on three design decisions that distinguish it from the existing literature: (i) synthetic, standardised cases remove the record-completeness variability that confounds retrospective comparisons and allow the identical input to be given to every board and every model; (ii) two independent tumour boards per localisation let human-human agreement be measured rather than assumed; and (iii) a guideline matrix, locked a priori, provides an objective anchor applied identically to human and model recommendations.
Reference standard. For each case-domain, a guideline matrix (guideline-recommended / acceptable / unsupported options per case-domain; ESMO, NCCN), locked and time-stamped before data collection, is applied identically to boards and models.
Five decision domains. Every recommendation is decomposed into D1 Intent, D2 Surgery, D3 Radiotherapy, D4 Systemic therapy (class + line), and D5 Work-up & biomarkers before any comparison.
Type d'étude
Inscription (Estimé)
Contacts et emplacements
Coordonnées de l'étude
- Nom: Jérôme Lambert, MD PhD
- Numéro de téléphone: +33 0142499742
- E-mail: jerome.lambert@u-paris.fr
Sauvegarde des contacts de l'étude
- Nom: Jean-Emmanuel Bibault, MD PhD
- Numéro de téléphone: +33 01 56 09 34 06
- E-mail: jean-emmanuel.bibault@aphp.fr
Lieux d'étude
-
-
-
Paris, France
- Recrutement
- Hôpital Europeén Georges Pompidou
-
Contact:
- Jean-Emmanuel Bibault, MD PhD
- Numéro de téléphone: +33 01 56 09 28 34
- E-mail: jean-emmanuel.bibault@aphp.fr
-
-
Critères de participation
Critère d'éligibilité
Âges éligibles pour étudier
- Adulte
- Adulte plus âgé
Accepte les volontaires sains
Méthode d'échantillonnage
Population étudiée
La description
Inclusion Criteria:
- Synthetic oncology case within one of the five predefined localisations (breast, lung, urological, digestive, gynaecological).
- Complete structured schema: UICC 8th-edition stage, biomarkers, ECOG performance status, comorbidities and a standardised clinical question.
- A clinically answerable treatment-planning question that is mappable to the locked guideline matrix.
Exclusion Criteria:
- Case outside the five predefined localisations.
- Incomplete, internally inconsistent or ambiguous schema.
- Duplicate or near-duplicate of an existing case in the set.
- Question not resolvable by current guidelines.
Plan d'étude
Comment l'étude est-elle conçue ?
Détails de conception
Cohortes et interventions
Groupe / Cohorte |
Intervention / Traitement |
|---|---|
|
Breast cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Lung cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Urological cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Digestive cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Gynaecological cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
Que mesure l'étude ?
Principaux critères de jugement
Mesure des résultats |
Description de la mesure |
Délai |
|---|---|---|
|
Domain-level performance between LLM recommendations and the locked guidelines.
Délai: Assessed once at central scoring, after data collection (~October 2026)
|
For each recommendation domain and each LLM, proportion of LLM recommendation concordant with locked guidelines
|
Assessed once at central scoring, after data collection (~October 2026)
|
Mesures de résultats secondaires
Mesure des résultats |
Description de la mesure |
Délai |
|---|---|---|
|
Proportion of recommendations carrying serious harm potential ( LLM and tumour boards)
Délai: Up to October 2026
|
Up to October 2026
|
|
|
Domain-level recommendation concordance between LLM and tumour-boards
Délai: Up to October 2026
|
Each recommendation domain, decomposed into the five decision domains and scored per domain on an ordinal scale (2 = complete concordance; 1 = partial concordance; 0 = discordance).
|
Up to October 2026
|
|
Inter-tumour board domain-level recommendation concordance
Délai: Up to October 2026
|
Agreement between the two independent tumour boards scored per recommendation domain
|
Up to October 2026
|
|
Equipoise rate
Délai: Up to October 2026
|
Proportion of case-domains where the two tumour boards give different categorical recommendations
|
Up to October 2026
|
|
Completeness
Délai: Up to October 2026
|
Proportion of required domains addressed (LLM and tumour boards)
|
Up to October 2026
|
|
Missingness
Délai: Up to October 2026
|
Proportion of critical omissions (LLM and tumour boards)
|
Up to October 2026
|
|
Intensity bias
Délai: Up to October 2026
|
Proportion of recommendation corresponding to over- or under-treatment
|
Up to October 2026
|
Collaborateurs et enquêteurs
Parrainer
Dates d'enregistrement des études
Dates principales de l'étude
Début de l'étude (Réel)
Achèvement primaire (Estimé)
Achèvement de l'étude (Estimé)
Dates d'inscription aux études
Première soumission
Première soumission répondant aux critères de contrôle qualité
Première publication (Réel)
Mises à jour des dossiers d'étude
Dernière mise à jour publiée (Réel)
Dernière mise à jour soumise répondant aux critères de contrôle qualité
Dernière vérification
Plus d'information
Termes liés à cette étude
Mots clés
- Tumeurs
- Sécurité du patient
- Intelligence artificielle
- Concordance
- Systèmes d'aide à la décision, cliniques
- Équipe de soins aux patients
- Reproductibilité
- Analyse comparative
- Grands modèles de langage
- Référence
- Clinical Decision support
- Multidisciplinary tumour board (RCP)
- Medical oncology
- Weighted kappa
- Synthetic data
Termes MeSH pertinents supplémentaires
- Maladies urogénitales
- Maladies génitales
- Tumeurs génitales, homme
- Tumeurs urogénitales
- Tumeurs par site
- Maladies génitales, sexe masculin
- Maladies de la prostate
- Maladies urogénitales masculines
- Maladies rénales
- Maladies urologiques
- Maladies urogénitales féminines
- Maladies urogénitales féminines et complications de la grossesse
- Maladies des voies respiratoires
- Maladies du système digestif
- Maladies pulmonaires
- Tumeurs des voies respiratoires
- Tumeurs thoraciques
- Maladies de la peau
- Maladies du sein
- Maladies de la vessie urinaire
- Maladies de la peau et du tissu conjonctif
- Tumeurs
- Tumeurs prostatiques
- Tumeurs pulmonaires
- Tumeurs mammaires
- Tumeurs de la vessie urinaire
- Tumeurs urologiques
- Tumeurs rénales
- Tumeurs du système digestif
Autres numéros d'identification d'étude
- APHP261032
Plan pour les données individuelles des participants (IPD)
Prévoyez-vous de partager les données individuelles des participants (DPI) ?
Informations sur les médicaments et les dispositifs, documents d'étude
Étudie un produit pharmaceutique réglementé par la FDA américaine
Étudie un produit d'appareil réglementé par la FDA américaine
Ces informations ont été extraites directement du site Web clinicaltrials.gov sans aucune modification. Si vous avez des demandes de modification, de suppression ou de mise à jour des détails de votre étude, veuillez contacter register@clinicaltrials.gov. Dès qu'un changement est mis en œuvre sur clinicaltrials.gov, il sera également mis à jour automatiquement sur notre site Web .