Denne side blev automatisk oversat, og nøjagtigheden af ​​oversættelsen er ikke garanteret. Der henvises til engelsk version for en kildetekst.

Forudsigelse af resultater efter lumbal fusion for degenerativ sygdom (FUSE-ML)

17. december 2021 opdateret af: Marc Schröder, Bergman Clinics

Udvikling og ekstern validering af en international, multicenter maskinlæringsalgoritme til forudsigelse af resultat efter lumbal spinal fusion for degenerativ sygdom: FUSE-ML-undersøgelsen

Formålet med FUSE-ML-studiet er at udvikle og eksternt validere et robust ML-baseret forudsigelsesværktøj baseret på multicenterdata fra en række internationale centre, som vil give individualiserede risiko-benefit-profiler skræddersyet til hver patient, der gennemgår lumbal spinalfusion for degenerativ sygdom . Data vil blive indsamlet af en række internationale centre.

Studieoversigt

Status

Afsluttet

Intervention / Behandling

Detaljeret beskrivelse

Indledning Lænderygsmerter er en af ​​de tre vigtigste årsager til handicap i vestlige samfund og påfører betydelige direkte og indirekte samfundsøkonomiske omkostninger. Ætiologien af ​​lænderygsmerter med eller uden udstrålende bensmerter er multifaktoriel, men den er ofte relateret til degenerativ diskussygdom (DDD) eller spondylolistese. Standardbehandlingen for symptomatisk spondylolistese eller progressiv DDD hos patienter, der ikke reagerer på langvarig konservativ behandling, er interbody-fusion, men dette er kontroversielt. Med nogle rapporter, der ikke viser nogen fordel sammenlignet med konservativ behandling, er patientvalg af afgørende betydning. Forskellige prognostiske tests forsøger at identificere undergrupper af patienter, der kan have størst gavn af kirurgi, men validiteten af ​​disse tests er uklar. I sidste ende bør succes i denne kategori af patienter defineres af forbedrede fysiske symptomer (patientrapporterede resultatmål [PROM'er]) snarere end teknisk succes af proceduren. En relevant andel af patienter med intraktabel, konservativ terapi-resistent lumbal degenerativ sygdom profiterer endelig på lumbal fusionskirurgi - det svære spørgsmål er, hvordan man kan identificere dem sikkert og undgå unødvendig, mislykket operation.

I litteraturen er der identificeret adskillige undergrupper af patienter med lumbal degenerativ sygdom, som kan drage mere fordel af lumbal spinal fusion end andre. Nøjagtig præoperativ identifikation af patienter med høj risiko for utilfredsstillende resultat og omvendt ville være klinisk fordelagtigt, da det ville muliggøre forbedret ressourceforberedelse, bedre kirurgisk beslutningstagning, forbedret patientuddannelse og informeret samtykke og potentielt endda modifikation af visse risikofaktorer for utilfredsstillende resultat. Det er dog ofte umuligt for klinikere at balancere de mange beskrevne enkeltrisikofaktorer for hver uønsket hændelse for at nå frem til en personlig risiko-benefit-profil hos individuelle patienter.

Maskinlæring (ML) metoder har været ekstraordinært effektive til at integrere mange kliniske patientvariabler i én holistisk risikoforudsigelse, der er skræddersyet til hver patient. En multicentermodel baseret på klassisk statistik er allerede blevet beskrevet af Khor et al. - Ved ekstern validering viste den sig dog at være upålidelig og temmelig dårligt kalibreret. Også denne model var baseret på et relativt lille antal patienter for ML. Formålet med FUSE-ML-studiet er at udvikle og eksternt validere et robust ML-baseret forudsigelsesværktøj baseret på multicenterdata fra en række internationale centre, som vil give individualiserede risiko-benefit-profiler skræddersyet til hver patient, der gennemgår lumbal spinalfusion for degenerativ sygdom .

Metodeoversigt Data vil blive indsamlet af en række internationale centre. Overordnet set vil modellerne blive bygget, og udgivelsen vil blive kompileret i henhold til den gennemsigtige rapportering af en multivariabel forudsigelsesmodel for individuel prognose eller diagnose (TRIPOD) retningslinjer. Der oprettes én model for hvert af de relevante resultater, der er beskrevet nedenfor.

Universitetet i Zürich (V.E. Staartjes, C. Serra) er sponsor for denne undersøgelse.

Etiske overvejelser Hvert center vil være ansvarligt for deres eget etiske nævn/institutionelle revisionsudvalg (IRB) godkendelse og for at etablere en dataoverførselsaftale (DTA). Sponsoren (University of Zurich) vil præsentere en standard DTA efter anmodning. De skal opnå godkendelse til retrospektiv eller fremtidig dataindsamling og deling af de fuldstændigt afidentificerede data med sponsoren. Sponsoren kan hjælpe ved at levere denne detaljerede undersøgelsesprotokol. Alle undersøgelsesprocedurer vil blive udført i overensstemmelse med Helsinki-erklæringen og dens ændringer.

Inklusions- og eksklusionskriterier Patienter med følgende indikationer for placering af thoracolumbar pedikelskrue overvejes for inklusion: Degenerative patologier (en eller flere af følgende: spinal stenose, spondylolistese, degenerativ diskussygdom, recidiverende diskusprolaps, mislykket rygkirurgi syndrom (FBSS), radikulopati, pseudarthrose). Patienter, der skal opereres for - som den primære indikation - infektioner, hvirveltumorer samt traumatiske og osteoporotiske frakturer eller misdannelsesoperationer for skoliose eller kyfose er ikke berettigede. Patienter med moderat eller svær skoliose (Coronal Cobb's >30 grader / Schwab-klassifikation sagittal modifier + eller ++) er ikke kvalificerede. Patienter, der skal opereres på mere end 6 vertebrale niveauer, er heller ikke kvalificerede. Patienter med manglende effektparameterdata efter 12 måneder vil blive udelukket. Patienter skal give informeret samtykke. Kun patienter på 18 år eller ældre kommer i betragtning til inklusion.

Dataindsamling Hvert center vil indsamle deres data enten retrospektivt, fra et prospektivt register eller fra et prospektivt register suppleret med retrospektivt indsamlede variabler. Hvert center skal bidrage med minimum 100 patienter med fuldstændige 12-måneders opfølgningsdata for at blive inkluderet i undersøgelsen. En standardiseret Excel-database vil blive stillet til rådighed af sponsoren til anonym dataindtastning. Dataene vil blive indtastet i standardiseret og afidentificeret form. Denne Excel-database vil kun indeholde et undersøgelsesspecifikt patientnummer. Hvert center fører et internt regneark, hvor de undersøgelsesspecifikke patientnumre kan spores tilbage til centerspecifikke patientnumre, hvis dette skulle være nødvendigt. Fristen for indsendelse af de fuldstændige data til sponsorinstitutionen er den 13. august 2021.

Authorship Centres skal bidrage med mindst 100 cases med fuldstændige udfaldsdata i alt for at blive inkluderet i undersøgelsen. Hvert deltagende center vil være i stand til at udpege maksimalt fire forfattere, der skal optages på forfatterlisten. Alle andre centerspecifikke bidragydere vil blive opført som fuldgyldige medlemmer af FUSE-ML-studiegruppen og vil få fuld PubMed/Medline-bidragyderstatus. Sponsorinstitutionen vil have seks primære forfatterstillinger til rådighed.

Primære slutpunktsdefinitioner

Flere endepunkter vil blive vurderet:

  • 1. Oswestry Disability Index (ODI) efter 12 måneder.
  • 2. Visuel analog skala (VAS-BP, 0 til 100) for rygsmerter efter 12 måneder. Dette kan også være en konverteret numerisk vurderingsskala (NRS) fra 0-10 eller en VAS fra 0 til 10 konverteret til 0 til 100.
  • 3. Visuel analog skala (VAS-LP, 0 til 100) for bensmerter efter 12 måneder. Dette kan også være en konverteret numerisk vurderingsskala (NRS) fra 0-10 eller en VAS fra 0 til 10 konverteret til 0 til 100.

Disse resultater vil blive dikotomiseret ved hjælp af den minimale klinisk vigtige forskel (MCID) ifølge Ostelo et al. Således vil en forbedring på 30 % eller større i en specifik score sammenlignet med baseline blive betragtet som opnåelse af MCID (klinisk succes) i den specifikke score. Hvis patienter havde nul symptomer initialt (i enten ODI, NRS-BP eller NRS-LP), og forblev på nul for den score, vil dette også blive defineret som MCID for den score.

Funktioner og deres definitioner

Alle funktioner er målt eller estimeret præoperativt. Ud over endepunkterne vil følgende inputfunktioner blive indsamlet:

  • Alder (år)
  • Køn (m/k)
  • Tilstedeværelse af følgende indikationer for operation (vælg alle relevante svar):

    • Spondylolistese
    • (tilbagevendende) diskusprolaps
    • Radikulopati
    • Kronisk lænderygsmerter (CLBP) / Degenerativ diskussygdom (DDD)
    • Mislykket rygkirurgi syndrom (FBSS)
    • Lumbal spinal stenose
    • Pseudarthrose
  • Indeksniveau(er) (vælg alle relevante, T12 - S1)
  • Højde (cm)
  • Vægt (kg)
  • BMI (kg/m2)
  • Rygestatus (aktiv / ophørt / aldrig)
  • Præoperativ (baseline) ODI
  • Præoperativ (baseline) VAS-BP
  • Præoperativ (baseline) VAS-LP
  • American Society of Anesthesiologists (ASA) Score (1-2 / 3 eller højere)
  • Præoperativ brug af opioid smertestillende medicin (ja/nej)
  • Astma pulmonale som en komorbiditet (ja/nej)
  • Tidligere thoracolumbar rygsøjleoperation (ja/nej)
  • Race/etnicitet (kaukasisk / sort / asiatisk / andet)
  • Kirurgisk tilgang (vælg alle relevante svar: TLIF / PLIF / ALIF / Lateral)
  • Indsættelse af pedikelskrue (ja/nej)
  • Minimalt invasiv teknik (ja/nej)

Prøvestørrelse Selv om selv den største kohorte med millioner af patienter ikke garanteres at resultere i en robust klinisk forudsigelsesmodel, hvis ingen relevante inputvariable er inkluderet ("skrald ind, skrald ud" - forvent ikke at forudsige fremtiden ud fra alder, køn, og kropsmasseindeks), er forholdet mellem forudsigelig ydeevne og prøvestørrelse bestemt direkte proportional, især for nogle data-hungrende ML-algoritmer. For at sikre generaliserbarhed af den kliniske forudsigelsesmodel bør stikprøvestørrelsen både være repræsentativ nok for patientpopulationen og tage højde for kompleksiteten af ​​algoritmen. For eksempel vil et dybt neuralt netværk - som et eksempel på en meget kompleks model - ofte kræve, at tusindvis af patienter konvergerer, mens en logistisk regressionsmodel kan opnå stabile resultater med kun nogle få hundrede patienter. Derudover spiller antallet af inputvariable en rolle. Groft kan det siges, at der kræves et minimum af 10 positive tilfælde pr. inkluderet inputvariabel for at modellere sammenhængene. Ofte observeres uregelmæssig opførsel af modellerne og høj varians i ydeevne blandt opdelinger, når stikprøvestørrelserne er mindre end beregnet med denne tommelfingerregel. Af central betydning er også andelen af ​​patienter, der oplever udfaldet. For meget sjældne hændelser er en meget større samlet stikprøvestørrelse følgelig nødvendig. For eksempel vil en forudsigelse baseret på 10 inputfunktioner for et udfald, der forekommer i kun 10 % af tilfældene, kræve mindst 1000 patienter inklusive mindst 100, der oplevede resultatet, i henhold til ovenstående tommelfingerregel. Generelt og fra personlig erfaring anbefaler forfatterne ikke at udvikle ML-modeller på kohorter med mindre end 100 positive tilfælde og rimeligt flere tilfælde i alt, uanset hvor sjældent resultatet er. Man kan også overveje den tilgængelige litteratur om risikofaktorer for udfaldet af interesse: Hvis epidemiologiske undersøgelser kun finder svage sammenhænge med resultatet, er det sandsynligt, at man vil kræve, at flere patienter kommer frem til en model med god prædiktiv ydeevne, i modsætning til et resultat, som har flere stærkt associerede risikofaktorer, som kan være lettere at forudsige. Større prøvestørrelser giver også mulighed for mere generøs evaluering gennem en større mængde patientdata dedikeret til træning eller validering og resulterer normalt i bedre kalibreringsforanstaltninger.

Mellem 20 % og 40 % af patienterne rapporterer ingen klinisk relevant forbedring efter spinal fusion (minoritetsklasse). Til beregning af stikprøvestørrelse tager forfatterne 20 % for et konservativt skøn. Som følge heraf anslår forfatterne for denne undersøgelse, baseret på forfatternes ekspertise og på de ovenfor nævnte tommelfingerregler, at minimum 200 patienter med et negativt udfald (minoritetsklasse) er nødvendige for at udtrække generaliserbare egenskabsrelationer. Med en estimeret forekomst på ca. 20 % som forklaret ovenfor, betyder det, at der kræves minimum omkring 1000 patienter til træning. For tilstrækkelig evaluering af kalibrering ved ekstern validering anslår forfatterne, at der vil være behov for yderligere 300 patienter (altså ca. 60 patienter med et positivt resultat). I alt vurderer forfatterne således, at der er behov for minimum 1300 patienter for at nå frem til en robust model. Flere data vil sandsynligvis føre til større ydeevne og bedre kalibrering.

Prædiktiv modellering En KNN-imputer vil blive co-trænet til at imputere eventuelle manglende data, der kan forekomme i fremtidig anvendelse af modellen. Hvis der mangler data i træningssættet, vil det blive imputeret ved hjælp af nævnte KNN-imputer. Funktioner eller patienter med en mangel på mere end 25 % vil blive udelukket. Data vil blive standardiseret og one-hot-kodet. I tilfælde af større klasseubalance - hvilket forventes for ovennævnte endepunkt - vil tilfældig upsampling eller syntetisk minoritetsoversampling (SMOTE) blive anvendt på træningssættet. Alle funktioner vil i første omgang blive leveret til modellen til træning. Hvis det er nødvendigt, vil forfatterne anvende rekursiv funktionseliminering (RFE) til at vælge inputfunktioner på træningsdataene.

Forfatterne vil afprøve følgende algoritmer til binær klassificering: Generaliseret lineær model (GLM), generaliseret additiv model (GAM), stokastisk gradient boosting maskine (GBM), naiv Bayes klassifikator, simpelt kunstigt neuralt netværk, support vektor maskine (SVM) og tilfældig skov. Hver model vil være fuldt trænet og hyperparameter tunet, hvor det er relevant. Den endelige model vil blive udvalgt baseret på AUC, sensitivitet og specificitet samt kalibreringsmålinger for den resampede træningspræstation. Træning vil foregå i gentagen 5-fold krydsvalidering med 10 gentagelser.

Den ene sidste model vil derefter kun blive vurderet på de eksterne valideringsdata én gang. 95 % konfidensintervaller for eksterne valideringsmetrikker vil blive udledt ved hjælp af bootstrap.

Tærsklen for binær klassificering vil enten blive identificeret på træningsdataene alene ved hjælp af det AUC-baserede "tættest-på-(0,1)-kriterium" eller Youdens indeks for at optimere både sensitivitet og specificitet, eller vil blive optimeret på træningssættet baseret på klinisk signifikans (rule-out model). Alle analyser vil blive udført i R Version 4.0.2 eller nyere.

Evaluering Klassifikationsmodellers ydeevne kan groft sagt bedømmes ud fra to dimensioner: Modeldiskriminering og kalibrering. Begrebet diskrimination betegner en forudsigelsesmodels evne til korrekt at klassificere, om en bestemt patient vil eller ikke vil opleve et bestemt resultat. Således beskrev diskrimination nøjagtigheden af ​​en binær forudsigelse - ja eller nej. Kalibrering beskriver imidlertid i hvilken grad en models forudsagte sandsynligheder (spænder fra 0 % til 100 %) svarer til den faktisk observerede forekomst af det binære endepunkt (sandt posterior). Mange publikationer rapporterer ikke kalibreringsmålinger, selvom disse er af central betydning, da en velkalibreret forudsagt sandsynlighed (f.eks. din forudsagte sandsynlighed for at opleve en komplikation er 18%) er ofte meget mere værdifuld for klinikere - og patienter! - end en binær forudsigelse (f.eks. du vil sandsynligvis ikke opleve en komplikation).

Gensamplet træningspræstation samt præstation på det eksterne valideringssæt vil blive vurderet for diskrimination og kalibrering. Med hensyn til diskrimination vil forfatterne evaluere AUC, nøjagtighed, sensitivitet, specificitet, positiv prædiktiv værdi (PPV), negativ prædiktiv værdi (NPV) og F1-score. Med hensyn til kalibrering vil forfatterne vurdere Brier-score, forventet-observeret (E/O)-forhold, kalibreringshældning og intercept, Hosmer-Lemeshow goodness-of-fit-testen samt visuel inspektion af kalibreringsplot for begge datasæt, som også vil indgå i publikationen.

Tolkelighed Graden og valget af metoder til fortolkning vil afhænge af den endeligt valgte algoritme. Nogle algoritmer kan naturligt give forklaringer på, hvilke faktorer der påvirker resultatet på hvilken måde. I tilfælde af at f.eks. en GLM-, GAM- eller naiv Bayes-klassifikator er valgt, vil parametrene / partielle afhængighedsværdier blive angivet. For simple beslutningstræer kan der leveres diagrammer over beslutningsprocessen. Andre modeller med højere grader af kompleksitet, såsom neurale netværk eller stokastiske gradientforstærkende maskiner, kan ikke naturligt give sådanne forklaringer. I så fald vil forfatterne give både AUC-baseret variabel betydning såvel som modelagnostiske lokale fortolkninger af variabel betydning ved brug af LIME-princippet.

Forventede resultater Forfatterne forventer at nå frem til en generaliserbar model baseret på internationale multicenterdata, der sandsynligvis vil forudsige konsistent med en AUC på mindst 0,70, og som er velkalibreret. Et webbaseret forudsigelsesværktøj vil også blive skabt til hver af de to modeller ved hjælp af det skinnende miljø, meget beslægtet med f.eks. https://neurosurgery.shinyapps.io/impairment (Se også for eksempel: Staartjes et al., Journal of Neurosurgery, 2020). Denne webbaserede app vil være tilgængelig gratis på enhver internet-kompatible enhed (mobil eller desktop), og bør være stabil på de fleste enheder på grund af den server-baserede computing. Udgifterne til vedligeholdelse af serveren afholdes af sponsoren. De indsamlede data vil blive opbevaret af sponsor i 10 år. Det store datasæt vil være åbent for yderligere analyse og vil blive leveret til ethvert af de bidragende centre efter rimelig anmodning og efter godkendelse fra alle andre centre. Målet er at muliggøre andre analyser ved hjælp af det indsamlede datasæt. Hvis yderligere analyser fører til offentliggørelse, vil alle bidragydere blive inkluderet som medforfattere, og alle medforfattere vil have mulighed for at gennemgå nævnte manuskript på forhånd. Ethvert medvirkende studiecenter har ret til at nedlægge veto mod offentliggørelse af eventuelle efterfølgende analyser, der indeholder egne data.

Undersøgelsestype

Observationel

Tilmelding (Faktiske)

1115

Kontakter og lokationer

Dette afsnit indeholder kontaktoplysninger for dem, der udfører undersøgelsen, og oplysninger om, hvor denne undersøgelse udføres.

Studiesteder

      • Paris, Frankrig
        • La Pitié Salpêtrière Hospital
      • Naarden, Holland, 1411 GE
        • Department of Neurosurgery, Bergman Clinics
      • Naarden, Holland, GE
        • Bergman Clinics
      • Innsbruck, Østrig
        • Medical University of Innsbruck

Deltagelseskriterier

Forskere leder efter personer, der passer til en bestemt beskrivelse, kaldet berettigelseskriterier. Nogle eksempler på disse kriterier er en persons generelle helbredstilstand eller tidligere behandlinger.

Berettigelseskriterier

Aldre berettiget til at studere

18 år og ældre (VOKSEN, OLDER_ADULT)

Tager imod sunde frivillige

N/A

Køn, der er berettiget til at studere

Alle

Prøveudtagningsmetode

Ikke-sandsynlighedsprøve

Studiebefolkning

Patienter, der gennemgik lumbal spinal fusion for degenerativ sygdom

Beskrivelse

  • Inklusionskriterier:
  • Degenerative patologier (en eller flere af følgende: spinal stenose, spondylolistese, degenerativ diskussygdom, tilbagevendende diskusprolaps, mislykket rygkirurgi syndrom (FBSS), radikulopati, pseudarthrose).
  • Patienter skal give informeret samtykke.
  • Kun patienter på 18 år eller ældre kommer i betragtning til inklusion.

Ekskluderingskriterier:

  • Patienter, der skal opereres for - som den primære indikation - infektioner, hvirveltumorer samt traumatiske og osteoporotiske frakturer eller misdannelsesoperationer for skoliose eller kyfose er ikke berettigede. Patienter med moderat eller svær skoliose (Coronal Cobb's >30 grader / Schwab-klassifikation sagittal modifier + eller ++) er ikke kvalificerede.
  • Patienter, der skal opereres på mere end 6 vertebrale niveauer, er heller ikke kvalificerede.
  • Patienter med manglende effektparameterdata efter 12 måneder vil blive udelukket.

Studieplan

Dette afsnit indeholder detaljer om studieplanen, herunder hvordan undersøgelsen er designet, og hvad undersøgelsen måler.

Hvordan er undersøgelsen tilrettelagt?

Design detaljer

Hvad måler undersøgelsen?

Primære resultatmål

Resultatmål
Foranstaltningsbeskrivelse
Tidsramme
Visuel analog skala for rygsmerter
Tidsramme: 12 måneder efter operationen
Visual Analogue Scale (VAS) for rygsmerters sværhedsgrad fra 0 til 100, med højere score, der indikerer mere smerte.
12 måneder efter operationen
Visuel analog skala til bensmerter
Tidsramme: 12 måneder efter operationen
Visuel analog skala (VAS) for sværhedsgrad af bensmerter fra 0 til 100, med højere score, der indikerer mere smerte.
12 måneder efter operationen
Oswestry handicapindeks
Tidsramme: 12 måneder efter operationen
Oswestry Disability Index (ODI) for subjektiv funktionsnedsættelse (0 til 100, med højere værdier, der indikerer højere niveauer af funktionsnedsættelse)
12 måneder efter operationen

Samarbejdspartnere og efterforskere

Det er her, du vil finde personer og organisationer, der er involveret i denne undersøgelse.

Sponsor

Efterforskere

  • Studieleder: Marc L Schröder, MD PhD, Bergman Clinics

Datoer for undersøgelser

Disse datoer sporer fremskridtene for indsendelser af undersøgelsesrekord og resumeresultater til ClinicalTrials.gov. Studieregistreringer og rapporterede resultater gennemgås af National Library of Medicine (NLM) for at sikre, at de opfylder specifikke kvalitetskontrolstandarder, før de offentliggøres på den offentlige hjemmeside.

Studer store datoer

Studiestart (FAKTISKE)

1. januar 2021

Primær færdiggørelse (FAKTISKE)

1. november 2021

Studieafslutning (FAKTISKE)

1. november 2021

Datoer for studieregistrering

Først indsendt

2. december 2021

Først indsendt, der opfyldte QC-kriterier

15. december 2021

Først opslået (FAKTISKE)

16. december 2021

Opdateringer af undersøgelsesjournaler

Sidste opdatering sendt (FAKTISKE)

10. januar 2022

Sidste opdatering indsendt, der opfyldte kvalitetskontrolkriterier

17. december 2021

Sidst verificeret

1. december 2021

Mere information

Begreber relateret til denne undersøgelse

Plan for individuelle deltagerdata (IPD)

Planlægger du at dele individuelle deltagerdata (IPD)?

INGEN

Lægemiddel- og udstyrsoplysninger, undersøgelsesdokumenter

Studerer et amerikansk FDA-reguleret lægemiddelprodukt

Ingen

Studerer et amerikansk FDA-reguleret enhedsprodukt

Ingen

Disse oplysninger blev hentet direkte fra webstedet clinicaltrials.gov uden ændringer. Hvis du har nogen anmodninger om at ændre, fjerne eller opdatere dine undersøgelsesoplysninger, bedes du kontakte register@clinicaltrials.gov. Så snart en ændring er implementeret på clinicaltrials.gov, vil denne også blive opdateret automatisk på vores hjemmeside .

Abonner