Denna sida har översatts automatiskt och översättningens korrekthet kan inte garanteras. Vänligen se engelsk version för en källtext.

Skalbar klinisk övervakning av stora språkmodeller via osäkerhetstriangulering (SCOUT)

Prospektiv utvärdering av ett modelloberoende meta-verifieringsramverk (SCOUT) för skalbart kliniskt tillsyn av stora språkmodellutdata vid diagnostik av kranskärlssjukdom: En multilesar-, randomiserad, korsövergångsstudie

Denna prospektiva, flerläsförsöks-, randomiserade korsningstrial utvärderar SCOUT (Scalable Clinical Oversight via Uncertainty Triangulation), ett modellagnostiskt meta-verifieringsramverk som selektivt överlåter opålitliga stora språkmodells (LLM) förutsägelser till kliniker genom att triangulera tre ortogonala osäkerhetssignaler: modellheterogenitet, stokastisk inkonsistens och resonemangskritik. Studien bedömer om SCOUT-assisterad granskning kan minska läkarnas granskningsjämfört med standard manuell granskning av AI-genererade diagnoser samtidigt som den bibehåller icke-underlägsn diagnostisk noggrannhet vid subtypering av kranskärlssjukdom (CHD).

Studieöversikt

Detaljerad beskrivning

Bakgrund: Stora språkmodeller används alltmer i kliniska arbetsflöden, men att kräva att kliniker granskar varje AI-utdata förnekar de effektivitetsvinster som motiverar deras införande. SCOUT adresserar denna effektivitet-säkerhet-paradox genom algoritmisk metaverifiering.

SCOUT-ramverket triangulerar tre ortogonala externa signaler för att bestämma fallnivåosäkerhet: (1) Modellheterogenitet - om en strukturellt annorlunda hjälp-LLM stämmer överens med den primära modellen; (2) Stokastisk inkonsistens - om upprepad sampling från samma modell ger divergerande utdata; (3) Resonemangskritik - om en extern kontrollmodell identifierar logiska brister i kedjan-av-tankande-resonemanget.

I denna korsningsstudie granskar 7 kliniker med varierande senioritet (2 junior ST-läkare, 3 senior ST-läkare, 2 översättande läkare) var och en alla 110 fall under både standard manuell granskning och SCOUT-assisterade granskningsarbetsflöden. Studien utvärderar arbetsflödeseffektivitet (primär ändpunkt) och diagnostisk noggrannhet (sekundär ändpunkt).

Studietyp

Interventionell

Inskrivning (Beräknad)

7

Fas

  • Inte tillämpbar

Kontakter och platser

Det här avsnittet innehåller kontaktuppgifter för dem som genomför studien och information om var denna studie genomförs.

Studiekontakt

Deltagandekriterier

Forskare letar efter personer som passar en viss beskrivning, så kallade behörighetskriterier. Några exempel på dessa kriterier är en persons allmänna hälsotillstånd eller tidigare behandlingar.

Urvalskriterier

Åldrar som är berättigade till studier

  • Vuxen
  • Äldre vuxen

Tar emot friska volontärer

Nej

Beskrivning

Inklusionskriterier:

  • Specialistutbildade eller under utbildning kardiologer på Fuwai Hospital
  • Som täcker tre erfarenhetsnivåer: junior läkare, senior läkare, överläkare

Exklusionskriterier:

  • Kliniker involverade i utvecklingen eller optimeringen av SCOUT-ramverket
  • Kliniker involverade i guldstandardsbedömningsprocessen

Studieplan

Det här avsnittet ger detaljer om studieplanen, inklusive hur studien är utformad och vad studien mäter.

Hur är studien utformad?

Designdetaljer

  • Primärt syfte: Diagnostisk
  • Tilldelning: Randomiserad
  • Interventionsmodell: Crossover tilldelning
  • Maskning: Ingen (Open Label)

Vapen och interventioner

Deltagargrupp / Arm
Intervention / Behandling
Aktiv komparator: Kontroll (Standard manuell granskning)
Läkare granskar manuellt alla fall i kontrollgruppen (n=54) med tillgång till AI-förutsägelser och motiveringar. Inget selektivt uppskjutande.
Läkare utför en fullständig manuell granskning av 54 fall med hjälp av råa medicinska journaler med tillgång till AI-modellens förutsägelser och resonemang, men utan SCOUT-osäkerhetsstratifiering eller selektiv uppskjutning.
Experimentell: Experimentell (SCOUT-Assisterad Granskning)
Läkare bearbetar interventionsuppsättningen (n=56) genom SCOUT-ramverket. Fall med låg osäkerhet accepteras automatiskt; fall med hög osäkerhet genomgår läkargranskning med fullständig revisionslogg.
SCOUT-Assisted Review (Interventionsarm): Läkare granskar 56 fall som bearbetats genom SCOUT-ramverket. För fall som klassificeras som låg osäkerhet (D(x)=0) accepteras AI-förutsägelsen automatiskt utan läkargranskning. För hög osäkerhetsfall (D(x)=1) granskar läkaren fallet med tillgång till huvudmodellens chain-of-thought-resonemang och meta-verifieringsgranskningsresultaten. Huvudmodellen är DeepSeek-V3.1 med chain-of-thought-prompting.

Vad mäter studien?

Primära resultatmått

Resultatmått
Åtgärdsbeskrivning
Tidsram
Genomsnittlig läkartidsåtgång per fall (minuter)
Tidsram: Under studiens genomförande, i genomsnitt 2 timmar.
Genomsnittlig tid som varje kliniker ägnar åt att granska och fatta ett diagnostiskt beslut per fall under varje arm.
Mäts i minuter.
Under studiens genomförande, i genomsnitt 2 timmar.

Sekundära resultatmått

Resultatmått
Åtgärdsbeskrivning
Tidsram
Diagnostisk noggrannhet (%)
Tidsram: Under studiegenomförandet, i genomsnitt 2 timmar.
Andel korrekta klassificeringar av KHS-subtyp (STEMI, NSTEMI, instabil angina, kroniska kranskärlssyndrom) i varje arm.
Under studiegenomförandet, i genomsnitt 2 timmar.
Beräkningsmässig Avkastning på Investering (ROI)
Tidsram: Genom studiens slutförande, i genomsnitt 2 timmar.
Kvot mellan läkartidsbesparingar (värderade till standardiserade minutlöner från Sanming-hälso- och sjukvårdsreformens riktmärken) och beräkningskostnaden för SCOUT-slutsatsdragning, stratifierad efter klinikers yrkeserfarenhetsnivå.
Genom studiens slutförande, i genomsnitt 2 timmar.

Samarbetspartners och utredare

Det är här du hittar personer och organisationer som är involverade i denna studie.

Studieavstämningsdatum

Dessa datum spårar framstegen för inlämningar av studieposter och sammanfattande resultat till ClinicalTrials.gov. Studieposter och rapporterade resultat granskas av National Library of Medicine (NLM) för att säkerställa att de uppfyller specifika kvalitetskontrollstandarder innan de publiceras på den offentliga webbplatsen.

Studera stora datum

Studiestart (Beräknad)

19 februari 2026

Primärt slutförande (Beräknad)

28 februari 2026

Avslutad studie (Beräknad)

28 februari 2026

Studieregistreringsdatum

Först inskickad

9 februari 2026

Först inskickad som uppfyllde QC-kriterierna

14 februari 2026

Första postat (Faktisk)

17 februari 2026

Uppdateringar av studier

Senaste uppdatering publicerad (Faktisk)

17 februari 2026

Senaste inskickade uppdateringen som uppfyllde QC-kriterierna

14 februari 2026

Senast verifierad

1 februari 2026

Mer information

Termer relaterade till denna studie

Andra studie-ID-nummer

  • 2025-2702-1

Plan för individuella deltagardata (IPD)

Planerar du att dela individuella deltagardata (IPD)?

JA

IPD-planbeskrivning

Avidentifierade individuella deltagardata som ligger till grund för resultaten som rapporteras i denna studie kommer att göras tillgängliga.

Tidsram för IPD-delning

Börjar 1 månad efter publiceringen av de primära resultaten och tillgänglig i upp till 60 månader.

Kriterier för IPD Sharing Access

Data finns tillgängliga från motsvarande författare efter rimlig begäran. Begärare behöver lämna ett metodiskt välgrundat forskningsförslag och underteckna ett avtal för dataanvändning.

IPD-delning som stöder informationstyp

  • STUDY_PROTOCOL
  • SAV
  • ICF
  • ANALYTIC_CODE
  • CSR

Läkemedels- och apparatinformation, studiedokument

Studerar en amerikansk FDA-reglerad läkemedelsprodukt

Nej

Studerar en amerikansk FDA-reglerad produktprodukt

Nej

Denna information hämtades direkt från webbplatsen clinicaltrials.gov utan några ändringar. Om du har några önskemål om att ändra, ta bort eller uppdatera dina studieuppgifter, vänligen kontakta register@clinicaltrials.gov. Så snart en ändring har implementerats på clinicaltrials.gov, kommer denna att uppdateras automatiskt även på vår webbplats .

Prenumerera