- ICH GCP
- Registro de ensayos clínicos de EE. UU.
- Ensayo clínico NCT05161130
Predicción de los resultados después de la fusión lumbar por enfermedad degenerativa (FUSE-ML)
Desarrollo y validación externa de un algoritmo de aprendizaje automático multicéntrico internacional para la predicción del resultado después de la fusión espinal lumbar para enfermedades degenerativas: el estudio FUSE-ML
Descripción general del estudio
Estado
Condiciones
Intervención / Tratamiento
Descripción detallada
Introducción El dolor lumbar es una de las tres principales causas de discapacidad en las sociedades occidentales e impone importantes costos socioeconómicos directos e indirectos. La etiología del dolor lumbar con o sin dolor irradiado a la pierna es multifactorial, pero a menudo se relaciona con la enfermedad degenerativa del disco (EDD) o con la espondilolistesis. El tratamiento estándar para la espondilolistesis sintomática o DDD progresiva en pacientes que no responden al tratamiento conservador a largo plazo es la fusión intersomática, pero esto es controvertido. Dado que algunos informes no muestran ningún beneficio en comparación con el tratamiento conservador, la selección de pacientes es de vital importancia. Varias pruebas de pronóstico intentan identificar subconjuntos de pacientes que podrían beneficiarse más de la cirugía, pero la validez de estas pruebas no está clara. En última instancia, el éxito en esta categoría de pacientes debe definirse por la mejora de los síntomas físicos (medidas de resultado informadas por el paciente [PROM]) en lugar del éxito técnico del procedimiento. Una proporción relevante de pacientes con enfermedad degenerativa lumbar intratable y resistente a la terapia conservadora finalmente se beneficia de la cirugía de fusión lumbar; la pregunta difícil es cómo identificarlos de manera segura y evitar una cirugía innecesaria y sin éxito.
En la literatura, se han identificado varios subgrupos de pacientes con enfermedad degenerativa lumbar que pueden beneficiarse más que otros de la fusión espinal lumbar. La identificación preoperatoria precisa de pacientes con alto riesgo de resultados insatisfactorios y viceversa sería clínicamente ventajosa, ya que permitiría una mejor preparación de recursos, una mejor toma de decisiones quirúrgicas, una mejor educación del paciente y consentimiento informado, y potencialmente incluso la modificación de ciertos factores de riesgo para resultado insatisfactorio. Sin embargo, a menudo es imposible para los médicos equilibrar los muchos factores de riesgo individuales descritos para cada evento adverso para llegar a un perfil personalizado de riesgo-beneficio en pacientes individuales.
Los métodos de aprendizaje automático (ML) han sido extraordinariamente efectivos para integrar muchas variables clínicas del paciente en una predicción de riesgo holística adaptada a cada paciente. Un modelo multicéntrico basado en estadísticas clásicas ya ha sido descrito por Khor et al. - Sin embargo, tras la validación externa, demostró ser poco fiable y bastante mal calibrado. Además, este modelo se basó en un número relativamente pequeño de pacientes con ML. El objetivo del estudio FUSE-ML es desarrollar y validar externamente una sólida herramienta de predicción basada en ML basada en datos multicéntricos de una variedad de centros internacionales que proporcionarán perfiles de riesgo-beneficio individualizados adaptados a cada paciente que se someterá a una fusión espinal lumbar por enfermedad degenerativa. .
Descripción general de los métodos Los datos serán recopilados por una variedad de centros internacionales. En general, los modelos se construirán y la publicación se compilará de acuerdo con los informes transparentes de un modelo de predicción multivariable para las pautas de pronóstico o diagnóstico individual (TRIPOD). Se creará un modelo para cada uno de los resultados relevantes que se detallan a continuación.
Universidad de Zúrich (V. E. Staartjes, C. Serra) es el patrocinador de este estudio.
Consideraciones éticas Cada centro será responsable de la aprobación de su propia junta de ética/junta de revisión institucional (IRB) y de establecer un acuerdo de transferencia de datos (DTA). El patrocinador (Universidad de Zúrich) presentará un DTA estándar a pedido. Deben obtener la aprobación para la recopilación retrospectiva o prospectiva de datos y el intercambio de datos completamente desidentificados con el patrocinador. El patrocinador puede ayudar proporcionando este protocolo de estudio detallado. Todos los procedimientos de estudio se llevarán a cabo de acuerdo con la Declaración de Helsinki y sus enmiendas.
Criterios de inclusión y exclusión Los pacientes con las siguientes indicaciones para la colocación de tornillos pediculares toracolumbar se consideran para la inclusión: Patologías degenerativas (una o varias de las siguientes: estenosis espinal, espondilolistesis, enfermedad degenerativa del disco, hernia de disco recurrente, síndrome de cirugía fallida de espalda (FBSS), radiculopatía, pseudoartrosis). Los pacientes sometidos a cirugía por, como indicación principal, infecciones, tumores vertebrales, así como fracturas traumáticas y osteoporóticas o cirugía de deformidad por escoliosis o cifosis no son elegibles. Los pacientes con escoliosis moderada o grave (Coronal Cobb >30 grados/modificador sagital de la clasificación de Schwab + o ++) no son elegibles. Los pacientes que se someten a cirugía en más de 6 niveles vertebrales tampoco son elegibles. Se excluirán los pacientes a los que les falten datos de punto final a los 12 meses. Los pacientes están obligados a dar su consentimiento informado. Solo se consideran para la inclusión los pacientes de 18 años o más.
Recopilación de datos Cada centro recopilará sus datos de forma retrospectiva, de un registro prospectivo, o de un registro prospectivo complementado con variables recopiladas retrospectivamente. Cada centro tiene que aportar un mínimo de 100 pacientes con datos completos de seguimiento de 12 meses para ser incluidos en el estudio. El patrocinador proporcionará una base de datos Excel estandarizada para la entrada de datos anónimos. Los datos se ingresarán en forma normalizada y desidentificada. Esta base de datos de Excel solo contendrá un número de paciente específico del estudio. Cada centro mantendrá una hoja de cálculo interna en la que los números de pacientes específicos del estudio se pueden rastrear hasta los números de pacientes específicos del centro, en caso de que sea necesario. La fecha límite para el envío de los datos completos a la institución patrocinadora es el 13 de agosto de 2021.
Los centros de autoría deberán contribuir con al menos 100 casos con datos completos de resultados en total para ser incluidos en el estudio. Cada centro participante podrá designar un máximo de cuatro autores para incluir en la lista de autores. Cualquier otro colaborador específico del centro aparecerá como miembro de pleno derecho del grupo de estudio FUSE-ML y se le otorgará el estatus de colaborador completo de PubMed/Medline. La institución patrocinadora tendrá disponibles seis puestos de autores principales.
Definiciones de criterios de valoración primarios
Se evaluarán varios puntos finales:
- 1. Índice de discapacidad de Oswestry (ODI) a los 12 meses.
- 2. Escala analógica visual (EVA-BP, 0 a 100) para el dolor de espalda a los 12 meses. Esto también puede ser una escala de calificación numérica (NRS) convertida de 0 a 10, o una VAS de 0 a 10 convertida de 0 a 100.
- 3. Escala Visual Analógica (EVA-LP, 0 a 100) de dolor en piernas a los 12 meses. Esto también puede ser una escala de calificación numérica (NRS) convertida de 0 a 10, o una VAS de 0 a 10 convertida de 0 a 100.
Estos resultados se dicotomizarán mediante la diferencia mínima clínicamente importante (MCID) según Ostelo et al. Por lo tanto, una mejora del 30 % o más en una puntuación específica en comparación con el valor inicial se considerará como logro de MCID (éxito clínico) en esa puntuación específica. Si los pacientes presentaron cero síntomas inicialmente (ya sea en ODI, NRS-BP o NRS-LP) y permanecieron en cero para esa puntuación, esto también se definirá como MCID para esa puntuación.
Características y sus definiciones
Todas las características se miden o estiman antes de la operación. Además de los puntos finales, se recopilarán las siguientes características de entrada:
- Años de edad)
- Sexo (m/f)
Presencia de las siguientes indicaciones para la cirugía (elija todas las que correspondan):
- espondilolistesis
- Hernia discal (recurrente)
- radiculopatía
- Dolor lumbar crónico (CLBP) / Enfermedad degenerativa del disco (DDD)
- Síndrome de cirugía fallida de espalda (FBSS)
- Estenosis raquídea lumbar
- pseudoartrosis
- Nivel(es) de índice (elija todo lo que corresponda, T12 - S1)
- Altura (cm)
- Peso (kg)
- IMC (kg/m2)
- Tabaquismo (activo/cesado/nunca)
- ODI preoperatorio (línea de base)
- Preoperatorio (basal) EVA-BP
- Preoperatorio (basal) EVA-LP
- Puntuación de la Sociedad Estadounidense de Anestesiólogos (ASA) (1-2/3 o superior)
- Uso preoperatorio de analgésicos opioides (sí/no)
- Asma pulmonar como comorbilidad (sí/no)
- Cirugía previa de columna toracolumbar (sí/no)
- Raza/Etnicidad (caucásico/negro/asiático/otro)
- Abordaje quirúrgico (elija todos los que correspondan: TLIF / PLIF / ALIF / Lateral)
- Inserción de tornillos pediculares (sí/no)
- Técnica mínimamente invasiva (sí/no)
Tamaño de la muestra Si bien no se garantiza que incluso la cohorte más grande con millones de pacientes resulte en un modelo de predicción clínica sólido si no se incluyen variables de entrada relevantes ("basura que entra, basura que sale": no espere predecir el futuro a partir de la edad, el género, el y el índice de masa corporal), la relación entre el rendimiento predictivo y el tamaño de la muestra es ciertamente directamente proporcional, especialmente para algunos algoritmos de aprendizaje automático hambrientos de datos. Para garantizar la generalización del modelo de predicción clínica, el tamaño de la muestra debe ser suficientemente representativo de la población de pacientes y debe tener en cuenta la complejidad del algoritmo. Por ejemplo, una red neuronal profunda, como ejemplo de un modelo altamente complejo, a menudo requerirá que converjan miles de pacientes, mientras que un modelo de regresión logística puede lograr resultados estables con solo unos pocos cientos de pacientes. Además, el número de variables de entrada juega un papel. Aproximadamente, se puede decir que se requiere un mínimo de 10 casos positivos por variable de entrada incluida para modelar las relaciones. A menudo, se observa un comportamiento errático de los modelos y una gran variación en el rendimiento entre divisiones cuando los tamaños de muestra son más pequeños que los calculados con esta regla general. De importancia central es también la proporción de pacientes que experimentan el resultado. Para eventos muy raros, se necesita, en consecuencia, un tamaño de muestra total mucho mayor. Por ejemplo, una predicción basada en 10 características de entrada para un resultado que ocurre solo en el 10 % de los casos requeriría al menos 1000 pacientes, incluidos al menos 100 que experimentaron el resultado, de acuerdo con la regla general anterior. En general y por experiencia personal, los autores no recomiendan desarrollar modelos de ML en cohortes con menos de 100 casos positivos y razonablemente más casos en total, independientemente de la rareza del resultado. Además, se podría considerar la literatura disponible sobre los factores de riesgo para el resultado de interés: si los estudios epidemiológicos encuentran solo asociaciones débiles con el resultado, es probable que se requieran más pacientes para llegar a un modelo con un buen desempeño predictivo, en lugar de un resultado que tiene varios factores de riesgo altamente asociados, que pueden ser más fáciles de predecir. Los tamaños de muestra más grandes también permiten una evaluación más generosa a través de una mayor cantidad de datos de pacientes dedicados al entrenamiento o la validación y, por lo general, dan como resultado mejores medidas de calibración.
Entre el 20 % y el 40 % de los pacientes informan que no hay una mejoría clínicamente relevante después de la fusión espinal (clase minoritaria). Para el cálculo del tamaño de la muestra, los autores toman 20% para una estimación conservadora. En consecuencia, para este estudio, basándose en la experiencia de los autores y en las reglas generales mencionadas anteriormente, los autores estiman que se requiere un mínimo de 200 pacientes con un resultado negativo (clase minoritaria) para extraer relaciones de características generalizables. Con una incidencia estimada de aproximadamente el 20% como se explicó anteriormente, eso significa que se requiere un mínimo de alrededor de 1000 pacientes para el entrenamiento. Para una evaluación adecuada de la calibración en la validación externa, los autores estiman que se requerirán otros 300 pacientes (por lo tanto, aproximadamente 60 pacientes con un resultado positivo). Así, en total, los autores estiman que son necesarios un mínimo de 1300 pacientes para llegar a un modelo robusto. Más datos probablemente conducirán a un mayor rendimiento y una mejor calibración.
Modelado predictivo Un computador KNN será co-entrenado para imputar cualquier dato faltante que pueda ocurrir en futuras aplicaciones del modelo. Si faltan datos en el conjunto de entrenamiento, se imputarán utilizando dicho imputer KNN. Se excluirán características o pacientes con una falta mayor al 25%. Los datos serán estandarizados y codificados en caliente. En caso de desequilibrio de clase importante, que se espera para el criterio de valoración mencionado anteriormente, se aplicará al conjunto de entrenamiento un sobremuestreo aleatorio o un sobremuestreo minoritario sintético (SMOTE). Todas las funciones se proporcionarán inicialmente al modelo para el entrenamiento. Si es necesario, los autores aplicarán la eliminación recursiva de funciones (RFE) para seleccionar funciones de entrada en los datos de entrenamiento.
Los autores probarán los siguientes algoritmos para la clasificación binaria: modelo lineal generalizado (GLM), modelo aditivo generalizado (GAM), máquina de aumento de gradiente estocástico (GBM), clasificador naïve Bayes, red neuronal artificial simple, máquina de vectores de soporte (SVM) y bosque aleatorio. Cada modelo se entrenará por completo y se ajustarán los hiperparámetros cuando corresponda. El modelo final se seleccionará según el AUC, la sensibilidad y la especificidad, así como las métricas de calibración en el rendimiento del entrenamiento remuestreado. El entrenamiento ocurrirá en una validación cruzada repetida de 5 veces con 10 repeticiones.
El modelo final se evaluará en los datos de validación externa solo una vez. Los intervalos de confianza del 95 % para las métricas de validación externa se obtendrán mediante el método de arranque.
El umbral para la clasificación binaria se identificará solo en los datos de entrenamiento utilizando el "criterio más cercano a (0,1)" basado en AUC o el índice de Youden para optimizar tanto la sensibilidad como la especificidad, o se optimizará en el conjunto de entrenamiento. basado en la significación clínica (modelo de exclusión). Todos los análisis se realizarán en R Versión 4.0.2 o más reciente.
Evaluación El desempeño de los modelos de clasificación se puede juzgar aproximadamente en dos dimensiones: Discriminación y calibración del modelo. El término discriminación denota la capacidad de un modelo de predicción para clasificar correctamente si un determinado paciente experimentará o no un determinado resultado. Por lo tanto, la discriminación describía la precisión de una predicción binaria: sí o no. Sin embargo, la calibración describe el grado en que las probabilidades predichas de un modelo (que van del 0 % al 100 %) corresponden a la incidencia realmente observada del criterio de valoración binario (posterior verdadero). Muchas publicaciones no informan métricas de calibración, aunque estas son de importancia central, como una probabilidad predicha bien calibrada (p. su probabilidad prevista de sufrir una complicación es del 18 %) suele ser mucho más valiosa para los médicos y los pacientes. - que una predicción binaria (por ej. es probable que no experimente una complicación).
Se evaluará el rendimiento del entrenamiento remuestreado, así como el rendimiento en el conjunto de validación externa para discriminación y calibración. En términos de discriminación, los autores evaluarán el AUC, la precisión, la sensibilidad, la especificidad, el valor predictivo positivo (PPV), el valor predictivo negativo (NPV) y la puntuación F1. En cuanto a la calibración, los autores evaluarán la puntuación de Brier, la relación esperada-observada (E/O), la pendiente y el intercepto de la calibración, la prueba de bondad de ajuste de Hosmer-Lemeshow, así como la inspección visual de los gráficos de calibración para ambos conjuntos de datos, que también se incluirán en la publicación.
Interpretabilidad El grado y elección de métodos para la interpretabilidad dependerá del algoritmo finalmente elegido. Algunos algoritmos pueden proporcionar explicaciones nativas sobre qué factores influyen en el resultado de qué manera. Por lo tanto, en caso de, p. se elige un clasificador GLM, GAM o naïve Bayes, se proporcionarán los parámetros/valores de dependencia parcial. Para árboles de decisión simples, se pueden proporcionar diagramas del proceso de toma de decisiones. Otros modelos con mayores grados de complejidad, como las redes neuronales o las máquinas de aumento de gradiente estocástico, no pueden proporcionar tales explicaciones de forma nativa. En ese caso, los autores proporcionarán tanto la importancia variable basada en AUC como interpretaciones locales agnósticas del modelo de importancia variable utilizando el principio LIME.
Resultados esperados Los autores esperan llegar a un modelo generalizable basado en datos internacionales multicéntricos que probablemente prediga consistentemente con un AUC de al menos 0,70 y que esté bien calibrado. También se creará una herramienta de predicción basada en la web para cada uno de los dos modelos utilizando el entorno brillante, muy similar a, p. https://neurosurgery.shinyapps.io/impairment (Véase también, por ejemplo: Staartjes et al., Journal of Neurosurgery, 2020). Esta aplicación basada en la web estará disponible de forma gratuita en cualquier dispositivo con capacidad para Internet (móvil o de escritorio) y debería ser estable en la mayoría de los dispositivos debido a la informática basada en servidor. Los gastos de mantenimiento del servidor correrán a cargo del patrocinador. Los datos recopilados serán almacenados por el patrocinador durante 10 años. El gran conjunto de datos estará abierto a un análisis posterior y se proporcionará a cualquiera de los centros contribuyentes a pedido razonable y después de la aprobación de todos los demás centros. El objetivo es permitir otros análisis utilizando el conjunto de datos recopilados. Si algún análisis adicional conduce a la publicación, todos los colaboradores serán incluidos como coautores y todos los coautores tendrán la oportunidad de revisar dicho manuscrito de antemano. Cualquier centro de estudios contribuyente tiene derecho a vetar la publicación de cualquier análisis posterior que contenga sus propios datos.
Tipo de estudio
Inscripción (Actual)
Contactos y Ubicaciones
Ubicaciones de estudio
-
-
-
Innsbruck, Austria
- Medical University of Innsbruck
-
-
-
-
-
Paris, Francia
- La Pitié Salpêtrière Hospital
-
-
-
-
-
Naarden, Países Bajos, 1411 GE
- Department of Neurosurgery, Bergman Clinics
-
Naarden, Países Bajos, GE
- Bergman Clinics
-
-
Criterios de participación
Criterio de elegibilidad
Edades elegibles para estudiar
Acepta Voluntarios Saludables
Géneros elegibles para el estudio
Método de muestreo
Población de estudio
Descripción
- Criterios de inclusión:
- Patologías degenerativas (una o varias de las siguientes: estenosis espinal, espondilolistesis, enfermedad degenerativa del disco, hernia de disco recurrente, síndrome de cirugía de espalda fallida (FBSS), radiculopatía, pseudoartrosis).
- Los pacientes están obligados a dar su consentimiento informado.
- Solo se consideran para la inclusión los pacientes de 18 años o más.
Criterio de exclusión:
- Los pacientes sometidos a cirugía por, como indicación principal, infecciones, tumores vertebrales, así como fracturas traumáticas y osteoporóticas o cirugía de deformidad por escoliosis o cifosis no son elegibles. Los pacientes con escoliosis moderada o grave (Coronal Cobb >30 grados/modificador sagital de la clasificación de Schwab + o ++) no son elegibles.
- Los pacientes que se someten a cirugía en más de 6 niveles vertebrales tampoco son elegibles.
- Se excluirán los pacientes a los que les falten datos de punto final a los 12 meses.
Plan de estudios
¿Cómo está diseñado el estudio?
Detalles de diseño
¿Qué mide el estudio?
Medidas de resultado primarias
Medida de resultado |
Medida Descripción |
Periodo de tiempo |
|---|---|---|
|
Escala analógica visual para el dolor de espalda
Periodo de tiempo: 12 meses después de la cirugía
|
Escala analógica visual (VAS) para la gravedad del dolor de espalda de 0 a 100, donde las puntuaciones más altas indican más dolor.
|
12 meses después de la cirugía
|
|
Escala analógica visual para el dolor de piernas
Periodo de tiempo: 12 meses después de la cirugía
|
Escala analógica visual (VAS) para la gravedad del dolor en las piernas de 0 a 100, donde las puntuaciones más altas indican más dolor.
|
12 meses después de la cirugía
|
|
Índice de discapacidad de Oswestry
Periodo de tiempo: 12 meses después de la cirugía
|
Índice de discapacidad de Oswestry (ODI) para el deterioro funcional subjetivo (0 a 100, con valores más altos que indican niveles más altos de deterioro funcional)
|
12 meses después de la cirugía
|
Colaboradores e Investigadores
Patrocinador
Colaboradores
Investigadores
- Director de estudio: Marc L Schröder, MD PhD, Bergman Clinics
Fechas de registro del estudio
Fechas importantes del estudio
Inicio del estudio (ACTUAL)
Finalización primaria (ACTUAL)
Finalización del estudio (ACTUAL)
Fechas de registro del estudio
Enviado por primera vez
Primero enviado que cumplió con los criterios de control de calidad
Publicado por primera vez (ACTUAL)
Actualizaciones de registros de estudio
Última actualización publicada (ACTUAL)
Última actualización enviada que cumplió con los criterios de control de calidad
Última verificación
Más información
Términos relacionados con este estudio
Palabras clave
Términos MeSH relevantes adicionales
Otros números de identificación del estudio
- FUSE-ML
Plan de datos de participantes individuales (IPD)
¿Planea compartir datos de participantes individuales (IPD)?
Información sobre medicamentos y dispositivos, documentos del estudio
Estudia un producto farmacéutico regulado por la FDA de EE. UU.
Estudia un producto de dispositivo regulado por la FDA de EE. UU.
Esta información se obtuvo directamente del sitio web clinicaltrials.gov sin cambios. Si tiene alguna solicitud para cambiar, eliminar o actualizar los detalles de su estudio, comuníquese con register@clinicaltrials.gov. Tan pronto como se implemente un cambio en clinicaltrials.gov, también se actualizará automáticamente en nuestro sitio web. .