- ICH GCP
- Registro de ensayos clínicos de EE. UU.
- Ensayo clínico NCT07739121
Benchmarking Large Language Models Against Tumour Boards for Oncology Treatment Recommendations (BEACON)
Benchmarking AI for Clinical Oncology decisioNmaking (BEACON): A Prospective, Multicentre, Blinded Evaluation of Frontier Large Language Models Against Multidisciplinary Tumour Board Recommendations in Oncology Treatment Planning
Descripción general del estudio
Estado
Condiciones
- Neoplasias Renales
- Neoplasias Urológicas
- Neoplasias del Sistema Digestivo
- Neoplasias de mama
- Neoplasias Pulmonares
- Neoplasias prostáticas
- Neoplasias de la vejiga urinaria
- Sistemas de apoyo a la decisión, clínicos
- Toma de decisiones
- Neoplasias Genitales
- Inteligencia artificial
- Modelos de idiomas grandes
Intervención / Tratamiento
Descripción detallada
BEACON is a prospective, multicentre, blinded benchmark using automated, criteria-based scoring. It is built on three design decisions that distinguish it from the existing literature: (i) synthetic, standardised cases remove the record-completeness variability that confounds retrospective comparisons and allow the identical input to be given to every board and every model; (ii) two independent tumour boards per localisation let human-human agreement be measured rather than assumed; and (iii) a guideline matrix, locked a priori, provides an objective anchor applied identically to human and model recommendations.
Reference standard. For each case-domain, a guideline matrix (guideline-recommended / acceptable / unsupported options per case-domain; ESMO, NCCN), locked and time-stamped before data collection, is applied identically to boards and models.
Five decision domains. Every recommendation is decomposed into D1 Intent, D2 Surgery, D3 Radiotherapy, D4 Systemic therapy (class + line), and D5 Work-up & biomarkers before any comparison.
Tipo de estudio
Inscripción (Estimado)
Contactos y Ubicaciones
Estudio Contacto
- Nombre: Jérôme Lambert, MD PhD
- Número de teléfono: +33 0142499742
- Correo electrónico: jerome.lambert@u-paris.fr
Copia de seguridad de contactos de estudio
- Nombre: Jean-Emmanuel Bibault, MD PhD
- Número de teléfono: +33 01 56 09 34 06
- Correo electrónico: jean-emmanuel.bibault@aphp.fr
Ubicaciones de estudio
-
-
-
Paris, Francia
- Reclutamiento
- Hôpital Europeén Georges Pompidou
-
Contacto:
- Jean-Emmanuel Bibault, MD PhD
- Número de teléfono: +33 01 56 09 28 34
- Correo electrónico: jean-emmanuel.bibault@aphp.fr
-
-
Criterios de participación
Criterio de elegibilidad
Edades elegibles para estudiar
- Adulto
- Adulto Mayor
Acepta Voluntarios Saludables
Método de muestreo
Población de estudio
Descripción
Inclusion Criteria:
- Synthetic oncology case within one of the five predefined localisations (breast, lung, urological, digestive, gynaecological).
- Complete structured schema: UICC 8th-edition stage, biomarkers, ECOG performance status, comorbidities and a standardised clinical question.
- A clinically answerable treatment-planning question that is mappable to the locked guideline matrix.
Exclusion Criteria:
- Case outside the five predefined localisations.
- Incomplete, internally inconsistent or ambiguous schema.
- Duplicate or near-duplicate of an existing case in the set.
- Question not resolvable by current guidelines.
Plan de estudios
¿Cómo está diseñado el estudio?
Detalles de diseño
Cohortes e Intervenciones
Grupo / Cohorte |
Intervención / Tratamiento |
|---|---|
|
Breast cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Lung cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Urological cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Digestive cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
|
Gynaecological cancers
|
Two independent tumour boards per localisation (10 boards in total) issue a categorical recommendation for every synthetic case.
Where both boards agree, their consensus defines the reference standard; where they differ, the case-domain is classified as EQUIPOISE and analysed separately.
Five frontier LLMs (GPT-5.6,
Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Llama 4 Maverick) each receive the identical structured input for every case, three times in independent sessions, under locked prompts, versions and settings.
|
¿Qué mide el estudio?
Medidas de resultado primarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Domain-level performance between LLM recommendations and the locked guidelines.
Periodo de tiempo: Assessed once at central scoring, after data collection (~October 2026)
|
For each recommendation domain and each LLM, proportion of LLM recommendation concordant with locked guidelines
|
Assessed once at central scoring, after data collection (~October 2026)
|
Medidas de resultado secundarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Proportion of recommendations carrying serious harm potential ( LLM and tumour boards)
Periodo de tiempo: Up to October 2026
|
Up to October 2026
|
|
|
Domain-level recommendation concordance between LLM and tumour-boards
Periodo de tiempo: Up to October 2026
|
Each recommendation domain, decomposed into the five decision domains and scored per domain on an ordinal scale (2 = complete concordance; 1 = partial concordance; 0 = discordance).
|
Up to October 2026
|
|
Inter-tumour board domain-level recommendation concordance
Periodo de tiempo: Up to October 2026
|
Agreement between the two independent tumour boards scored per recommendation domain
|
Up to October 2026
|
|
Equipoise rate
Periodo de tiempo: Up to October 2026
|
Proportion of case-domains where the two tumour boards give different categorical recommendations
|
Up to October 2026
|
|
Completeness
Periodo de tiempo: Up to October 2026
|
Proportion of required domains addressed (LLM and tumour boards)
|
Up to October 2026
|
|
Missingness
Periodo de tiempo: Up to October 2026
|
Proportion of critical omissions (LLM and tumour boards)
|
Up to October 2026
|
|
Intensity bias
Periodo de tiempo: Up to October 2026
|
Proportion of recommendation corresponding to over- or under-treatment
|
Up to October 2026
|
Colaboradores e Investigadores
Patrocinador
Fechas de registro del estudio
Fechas importantes del estudio
Inicio del estudio (Actual)
Finalización primaria (Estimado)
Finalización del estudio (Estimado)
Fechas de registro del estudio
Enviado por primera vez
Primero enviado que cumplió con los criterios de control de calidad
Publicado por primera vez (Actual)
Actualizaciones de registros de estudio
Última actualización publicada (Actual)
Última actualización enviada que cumplió con los criterios de control de calidad
Última verificación
Más información
Términos relacionados con este estudio
Palabras clave
- Neoplasias
- Seguridad del paciente
- Inteligencia artificial
- Concordancia
- Sistemas de apoyo a la decisión, clínicos
- Equipo de atención al paciente
- Reproducibilidad
- Evaluación comparativa
- Modelos de lenguaje grandes
- Punto de referencia
- Clinical Decision support
- Multidisciplinary tumour board (RCP)
- Medical oncology
- Weighted kappa
- Synthetic data
Términos MeSH relevantes adicionales
- Enfermedades urogenitales
- Enfermedades Genitales
- Neoplasias Genitales Masculinas
- Neoplasias urogenitales
- Neoplasias por sitio
- Enfermedades Genitales Masculinas
- Enfermedades prostáticas
- Enfermedades urogenitales masculinas
- Enfermedades Renales
- Enfermedades urológicas
- Enfermedades urogenitales femeninas
- Enfermedades urogenitales femeninas y complicaciones del embarazo
- Enfermedades de las vías respiratorias
- Enfermedades del Sistema Digestivo
- Enfermedades pulmonares
- Neoplasias de las vías respiratorias
- Neoplasias torácicas
- Enfermedades de la piel
- Enfermedades de los senos
- Enfermedades de la vejiga urinaria
- Enfermedades de la piel y del tejido conectivo
- Neoplasias
- Neoplasias prostáticas
- Neoplasias Pulmonares
- Neoplasias de mama
- Neoplasias de la vejiga urinaria
- Neoplasias Urológicas
- Neoplasias Renales
- Neoplasias del Sistema Digestivo
Otros números de identificación del estudio
- APHP261032
Plan de datos de participantes individuales (IPD)
¿Planea compartir datos de participantes individuales (IPD)?
Información sobre medicamentos y dispositivos, documentos del estudio
Estudia un producto farmacéutico regulado por la FDA de EE. UU.
Estudia un producto de dispositivo regulado por la FDA de EE. UU.
Esta información se obtuvo directamente del sitio web clinicaltrials.gov sin cambios. Si tiene alguna solicitud para cambiar, eliminar o actualizar los detalles de su estudio, comuníquese con register@clinicaltrials.gov. Tan pronto como se implemente un cambio en clinicaltrials.gov, también se actualizará automáticamente en nuestro sitio web. .