Denne siden ble automatisk oversatt og nøyaktigheten av oversettelsen er ikke garantert. Vennligst referer til engelsk versjon for en kildetekst.

Skalerbar klinisk tilsyn av store språkmodeller via usikkerhetstriangulering (SCOUT)

Prospektiv evaluering av en modell-agnostisk meta-verifiseringsrammeverk (SCOUT) for skalerbar klinisk tilsyn av store språkmodellutdata i koronar hjertesykdom diagnostikk: En multi-leser, randomisert, crossover studie

Denne prospektive, flerleser, randomiserte crossover-studien evaluerer SCOUT (Scalable Clinical Oversight via Uncertainty Triangulation), en modellagnostisk metaverifiseringsrammeverk som selektivt utsetter upålitelige prediksjoner fra store språkmodeller (LLM) for klinikere ved å triangulere tre ortogonale usikkerhetssignaler: modellheterogenitet, stokastisk inkonsistens og resonneringskritikk. Studien vurderer om SCOUT-assistentgjennomgang kan redusere legenes gjennomgangstid sammenlignet med standard manuell gjennomgang av AI-genererte diagnoser, samtidig som den opprettholder ikke-underlegen diagnostisk nøyaktighet ved subtypering av koronar hjertesykdom (KHS).

Studieoversikt

Detaljert beskrivelse

Bakgrunn: Store språkmodeller brukes i økende grad i kliniske arbeidsflyter, men å kreve at klinikere gjennomgår hver AI-utdata neglerer effektivitetsgevinstene som motiverer deres innføring. SCOUT adresserer dette effektivitets-sikkerhetsparadokset gjennom algoritmisk metaverifisering.

SCOUT-rammeverket triangulerer tre ortogonale eksterne signaler for å bestemme usikkerhet på saksnivå: (1) Modellheterogenitet – om en strukturelt forskjellig hjelpe-LLM er enig med primærmodellen; (2) Stokastisk inkonsistens – om gjentatt utvalg fra samme modell gir divergerende utdata; (3) Resonneringskritikk – om en ekstern kontrollmodell identifiserer logiske feil i resonneringskjeden.

I denne kryssforsøket gjennomgår 7 klinikere med varierende senioritet (2 juniorresidensleger, 3 seniorresidensleger, 2 overleger) hver alle 110 sakene under både standard manuell gjennomgang og SCOUT-assisterte arbeidsflyter. Studien evaluerer arbeidsflyteffektivitet (primærendepunkt) og diagnostisk nøyaktighet (sekundærendepunkt).

Studietype

Intervensjonell

Registrering (Antatt)

7

Fase

  • Ikke aktuelt

Kontakter og plasseringer

Denne delen inneholder kontaktinformasjon for de som utfører studien, og informasjon om hvor denne studien blir utført.

Studiekontakt

Deltakelseskriterier

Forskere ser etter personer som passer til en bestemt beskrivelse, kalt kvalifikasjonskriterier. Noen eksempler på disse kriteriene er en persons generelle helsetilstand eller tidligere behandlinger.

Kvalifikasjonskriterier

Alder som er kvalifisert for studier

  • Voksen
  • Eldre voksen

Tar imot friske frivillige

Nei

Beskrivelse

Inklusjonskriterier:

  • Spesialist- eller under utdanning til spesialist i kardiologi ved Fuwai-sykehuset
  • Tre erfaringstrinn: yngre turnuskandidater, eldre turnuskandidater, overleger

Eksklusjonskriterier:

  • Klinikere involvert i utvikling eller optimalisering av SCOUT-rammeverket
  • Klinikere involvert i gullstandard-godkjenningsprosessen

Studieplan

Denne delen gir detaljer om studieplanen, inkludert hvordan studien er utformet og hva studien måler.

Hvordan er studiet utformet?

Designdetaljer

  • Primært formål: Diagnostisk
  • Tildeling: Randomisert
  • Intervensjonsmodell: Crossover-oppdrag
  • Masking: Ingen (Open Label)

Våpen og intervensjoner

Deltakergruppe / Arm
Intervensjon / Behandling
Aktiv komparator: Kontroll (Standard manuell gjennomgang)
Legene gjennomgår manuelt alle tilfellene i kontrollgruppen (n=54) med tilgang til KI-prediksjoner og begrunnelser. Ingen selektiv utsettelse.
Leger gjennomfører en fullstendig manuell gjennomgang av 54 saker ved hjelp av rå medisinske journaler med tilgang til AI-modellens spådommer og resonnement, men uten SCOUTs usikkerhetslagdeling eller selektiv utsettelse.
Eksperimentell: Eksperimentell (SCOUT-assistert gjennomgang)
Legene behandler intervensjonssettet (n=56) gjennom SCOUT-rammeverket. Lav-usikkerhetssaker aksepteres automatisk; høy-usikkerhetssaker gjennomgår legegjennomgang med full revisjonsspor.
SCOUT-assistert gjennomgang (intervensjonsarm): Legene gjennomgår 56 saker behandlet gjennom SCOUT-rammeverket. For saker klassifisert som lav usikkerhet (D(x)=0) blir AI-prediksjonen automatisk akseptert uten legegjennomgang. For høyt usikkerhetssaker (D(x)=1) gjennomgår legen saken med tilgang til hovedmodellens kjede-av-tankers resonnement og meta-verifiseringsrevisjonsresultatene. Hovedmodellen er DeepSeek-V3.1 med kjede-av-tankers prompting.

Hva måler studien?

Primære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
Gjennomsnittlig legegjennomgangstid per sak (minutter)
Tidsramme: Gjennom studieavslutning, i gjennomsnitt 2 timer.
Gjennomsnittlig tid brukt av hver kliniker på gjennomgang og avgjørelse av diagnostisk beslutning per sak i hver gruppe. Målt i minutter.
Gjennom studieavslutning, i gjennomsnitt 2 timer.

Sekundære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
Diagnostisk nøyaktighet (%)
Tidsramme: Gjennom studieavslutning, gjennomsnittlig 2 timer.
Andel korrekte klassifiseringer av KSS-subtyper (STEMI, NSTEMI, ustabil angina, kroniske koronarsyndromer) i hver arm.
Gjennom studieavslutning, gjennomsnittlig 2 timer.
Beregnet avkastning på investering (ROI)
Tidsramme: Gjennom studieavslutning, i gjennomsnitt 2 timer.
Forholdet mellom legetidssparing (verdsatt til standardiserte minuttlønninger fra Sanming helsereformreferanser) og beregningskostnaden for SCOUT-inferens, stratifisert etter klinikers erfaringsnivå.
Gjennom studieavslutning, i gjennomsnitt 2 timer.

Samarbeidspartnere og etterforskere

Det er her du vil finne personer og organisasjoner som er involvert i denne studien.

Studierekorddatoer

Disse datoene sporer fremdriften for innsending av studieposter og sammendragsresultater til ClinicalTrials.gov. Studieposter og rapporterte resultater gjennomgås av National Library of Medicine (NLM) for å sikre at de oppfyller spesifikke kvalitetskontrollstandarder før de legges ut på det offentlige nettstedet.

Studer hoveddatoer

Studiestart (Antatt)

19. februar 2026

Primær fullføring (Antatt)

28. februar 2026

Studiet fullført (Antatt)

28. februar 2026

Datoer for studieregistrering

Først innsendt

9. februar 2026

Først innsendt som oppfylte QC-kriteriene

14. februar 2026

Først lagt ut (Faktiske)

17. februar 2026

Oppdateringer av studieposter

Sist oppdatering lagt ut (Faktiske)

17. februar 2026

Siste oppdatering sendt inn som oppfylte QC-kriteriene

14. februar 2026

Sist bekreftet

1. februar 2026

Mer informasjon

Begreper knyttet til denne studien

Nøkkelord

Andre studie-ID-numre

  • 2025-2702-1

Plan for individuelle deltakerdata (IPD)

Planlegger du å dele individuelle deltakerdata (IPD)?

JA

IPD-planbeskrivelse

De-identifiserte individuelle deltakerdata som ligger til grunn for resultatene rapportert i denne studien, vil bli gjort tilgjengelig.

IPD-delingstidsramme

Begynner 1 måned etter publisering av de primære resultatene og tilgjengelig i opptil 60 måneder.

Tilgangskriterier for IPD-deling

Data er tilgjengelig fra den tilsvarende forfatteren ved rimelig forespørsel. Forespørrere må fremlegge et metodisk forsvarlig forskningsforslag og signere en dataavtale.

IPD-deling Støtteinformasjonstype

  • STUDY_PROTOCOL
  • SEVJE
  • ICF
  • ANALYTIC_CODE
  • CSR

Legemiddel- og utstyrsinformasjon, studiedokumenter

Studerer et amerikansk FDA-regulert medikamentprodukt

Nei

Studerer et amerikansk FDA-regulert enhetsprodukt

Nei

Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .

Abonnere