- ICH GCP
- US Clinical Trials Registry
- Klinisk utprøving NCT07470463
Evaluering av One-Shot Vision Differential Diagnosis (OSVDE) og Multi-Step Conversational Non-Inferiority (MSCNE) i AI-medisinske intervjuer. (OSVDE-MSCNE)
Evaluering av AI-medisinsk intervju- og diagnostiseringssystemets ytelse: One-Shot Vision Differensialdiagnose (OSVDE) og Multi-Step Conversational Non-Inferiority (MSCNE) evaluering.
Denne studien evaluerer den diagnostiske ytelsen til et multimodal kunstig intelligens (AI)-system (AIMD.1) som bruker avidentifiserte medisinske bilder og semisyntetiske pasientsimuleringer. Studien kombinerer retrospektiv analyse av eksisterende offentlig tilgjengelige bildedatasett med prospektiv datainnsamling fra spesialister med godkjenning som fullfører diagnostiske evalueringsoppgaver.
I One-Shot Vision Differential Evaluation (OSVDE)-fasen vurderer spesialistene individuelle avidentifiserte medisinske bilder og genererer en rangert liste over mulige diagnoser utelukkende basert på visuelle trekk. I Multi-Step Conversational Non-Inferiority Evaluation (MSCNE)-fasen fullfører spesialistene diagnostiske vurderinger ved hjelp av semisyntetiske pasientsimuleringer utledet fra avidentifiserte medisinske bilder. Spesialistenes ytelse vil bli sammenlignet med AI-systemet på de samme diagnostiske oppgavene.
Menneskelige deltakere består utelukkende av spesialister med godkjenning som gir diagnostiske svar. Medisinske bilder og simulerte tilfeller er studiemateriale og regnes ikke som studiedeltakere. Ingen identifiserbare pasientdata brukes, og AI-systemet evalueres i en offline forskningsmiljø og brukes ikke til klinisk beslutningstaking eller pasientbehandling.
Studieoversikt
Status
Intervensjon / Behandling
Detaljert beskrivelse
Kunstig intelligens (AI)-systemer har vist lovende evner i medisinsk diagnostikk; imidlertid er streng benchmark-evaluering nødvendig før klinisk implementering. AIMD.1 er et multimodal AI-diagnostisksystem designet for å assistere med klinisk resonnement gjennom analyse av medisinske bilder og konversasjonelle diagnostiske interaksjoner.
Denne studien evaluerer den diagnostiske ytelsen til AIMD.1 ved bruk av en kombinasjon av retrospektive bildedatasett og prospektive klinikerevalueringsoppgaver. Målet er å fastslå om AI-systemet oppnår diagnostisk nøyaktighet sammenlignbar med godkjente klinikere under kontrollerte benchmark-forhold.
Evalueringen inkluderer to komplementære stadier.
One-Shot Vision Differential Evaluation (OSVDE):
I dette stadiet vurderer AI-systemet og klinikerdeltakerne uavhengig individuelle de-identifiserte medisinske bilder og genererer rangert liste over potensielle diagnoser utelukkende basert på visuelle trekk. Evalueringen vil bruke omtrent 11 500–15 000 de-identifiserte medisinske bilder fra flere medisinske spesialiteter og sykdomskategorier med verifiserte referansediagnoser.
Multi-Step Conversational Non-Inferiority Evaluation (MSCNE):
I dette stadiet fullfører AI-systemet og klinikere diagnostiske oppgaver ved bruk av semisyntetiske pasientsimuleringer avledet fra de-identifiserte medisinske bilder. Disse simuleringene gir strukturert klinisk informasjon gjennom konversasjonelle interaksjoner, noe som muliggjør vurdering av diagnostisk resonnement over flere trinn. Omtrent 380–500 simulerte tilfeller vil bli evaluert.
Omtrent 10–30 godkjente klinikere vil delta i studien. Klinikere vil fullføre diagnostiske evalueringsøkter eksternt og vil gi differensialdiagnoser for delmengder av bildene og simuleringscasene. Menneskelige deltakere består utelukkende av klinikere som gir diagnostiske svar. Bildedatasettene og de syntetiske casene fungerer som studiemateriale og regnes ikke som deltakere.
Alle bilder brukt i studien er de-identifiserte og stammer fra offentlig tilgjengelige kilder eller datasett som oppfyller de-identifiseringsstandarder. Ytterligere forbehandlingstrinn sikrer fjerning av potensielt identifiserbar informasjon før inkludering i forskningsdatasettet.
AI-systemet evalueres i en offline forskningsmiljø og brukes ikke til å veilede virkelig klinisk omsorg eller pasientbehandling. Studien er designet som en benchmark-ytelsesevaluering før eventuell prospektiv validering som involverer ekte pasienter.
Primære utfallsmål inkluderer diagnostiske nøyaktighetsmål som Top-1 diagnostisk nøyaktighet, definert som andelen tilfeller der AI-systemets primærdiagnose samsvarer med referansediagnosen. Sekundære utfall inkluderer Top-5 diagnostisk nøyaktighet, kalibreringsmål, sensitivitet og spesifisitet på tvers av sykdomskategorier, og tid-til-diagnose-mål i konversasjonelle diagnostiske scenarier.
Dataanalyse vil estimere diagnostisk nøyaktighet med konfidensintervaller og sammenligne AI-systemets ytelse med klinikerytelse ved bruk av parrede statistiske tester og ikke-underlegenhetsanalyser.
Klinikersvar registreres ved bruk av anonyme studieidentifikatorer, og kun aggregerte ytelsesresultater vil rapporteres. Ingen identifiserbar informasjon om klinikere eller pasienter vil bli samlet inn eller publisert.
Studievarigheten forventes å være omtrent seks måneder, inkludert datasettforberedelse, klinikerevalueringsøkter og statistisk analyse.
Protokoll-ID 1026 er bekreftet som Unntatt i henhold til 45CFR46.104(d) Ex den 03.10.2026 av Solutions IRB (855) 226-4472 (www.solutionsirb.com)
Studietype
Registrering (Antatt)
Kontakter og plasseringer
Studiekontakt
- Navn: Luis R Soenksen, MSE, PhD
- Telefonnummer: (617) 936-9293
- E-post: soenksen@nollahealth.com
Studer Kontakt Backup
- Navn: Sean Geiger, B.S.
- Telefonnummer: (412) 412-8786
- E-post: sean@nollahealth.com
Studiesteder
-
-
New York
-
New York, New York, Forente stater, 10003
- Rekruttering
- Nolla Health (Magic Health Inc.)
-
Ta kontakt med:
- Sean Geiger, B.S.
- Telefonnummer: (412) 412-8786
- E-post: sean@nollahealth.com
-
Ta kontakt med:
- Luis R Soenksen, MSE, PhD
- Telefonnummer: (617)936-9293
- E-post: soenksen@nollahealth.com
-
Hovedetterforsker:
- Luis R Soenksen, MSE, PhD
-
Underetterforsker:
- Sean Geiger, B.S.
-
Underetterforsker:
- Luis Wenus
-
-
Deltakelseskriterier
Kvalifikasjonskriterier
Alder som er kvalifisert for studier
- Voksen
- Eldre voksen
Tar imot friske frivillige
Prøvetakingsmetode
Studiepopulasjon
Beskrivelse
Inklusjonskriterier:
- Aktiv spesialistgodkjenning i Dermatologi, Indremedisin, Øre-nese-hals, Gynekologi, Ortopedi, Pediatri, Geriatri, Akuttmedisin, Oftalmologi, Psykiatri, Endokrinologi, Allmennmedisin eller et nært beslektet spesialområde
- 18 år eller eldre
- Evne til å fullføre diagnostiske evalueringsøkter på nett ved hjelp av en datamaskin eller nettbrett med pålitelig internettilgang
Eksklusjonskriterier:
- Mistet aktiv spesialistgodkjenning i et kvalifiserende spesialområde
- Ute av stand til å fullføre evalueringsøkten på nett
Studieplan
Hvordan er studiet utformet?
Designdetaljer
Kohorter og intervensjoner
Gruppe / Kohort |
Intervensjon / Behandling |
|---|---|
|
Kliniker Deltakere
Lisensierte klinikere som deltar i diagnostiske evalueringsoppgaver ved bruk av de-identifiserte medisinske bilder og semi-syntetiske pasientsimuleringer for å vurdere diagnostisk nøyaktighet.
Klinikere gir differensialdiagnoser for sammenligning med et AI-diagnostisksystem.
|
AIMD.1 (også kjent som NollaMD-agent) er et multimodal kunstig intelligens (KI)-diagnostiseringssystem designet for å generere differensialdiagnoser basert på analyse av medisinske bilder og strukturert klinisk informasjon.
I denne studien evalueres systemet ved bruk av anonymiserte medisinske bilder og semi-syntetiske pasientsimuleringer under kontrollerte forskningsforhold.
KI-systemet genererer rangert diagnostisk utdata og tilhørende konfidensscore, som sammenlignes med referansediagnoser og klinikerprestasjonsmål.
Systemet evalueres i en offline forskningsmiljø.
KI-utdata brukes ikke til klinisk beslutningstaking, pasienthåndtering eller faktisk medisinsk behandling.
Andre navn:
|
Hva måler studien?
Primære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
Topp-1 Diagnostisk Nøyaktighet
Tidsramme: Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
|
Andel evaluerte tilfeller der primærdiagnosen generert av AI-diagnostisksystemet samsvarer med referansediagnosen (ground truth).
Nøyaktighet vil bli beregnet over anonymiserte medisinske bildetilfeller og semi-syntetiske pasientsimuleringstilfeller og sammenlignet med klinikerprestasjoner.
|
Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
|
Sekundære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
Topp-5 Diagnostisk Nøyaktighet
Tidsramme: Ved fullføring av diagnostiske evalueringer (opptil 6 måneder)
|
Andel evaluerte tilfeller der den korrekte referansediagnosen vises blant de fem øverst rangerte diagnosene generert av AI-diagnosesystemet.
|
Ved fullføring av diagnostiske evalueringer (opptil 6 måneder)
|
|
Diagnostisk nøyaktighet hos klinikerdeltakere
Tidsramme: Ved fullføring av diagnostiske evalueringer (opptil 6 måneder)
|
Andel evaluerte tilfeller der klinikerens primærdiagnose samsvarer med referansediagnosen, beregnet over tildelte bilder og simulerte tilfeller.
|
Ved fullføring av diagnostiske evalueringer (opptil 6 måneder)
|
|
Ikke-underlegenhet av AI-diagnostisk nøyaktighet sammenlignet med klinikere
Tidsramme: Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
|
Forskjell i Top-1 diagnostisk nøyaktighet mellom AI-diagnosesystemet og kliniker-deltakerne.
Ikke-underlegenhet vil bli vurdert ved hjelp av en forhåndsdefinert margin på 5%.
|
Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
|
|
Kalibrering av AI-diagnostisk konfidens
Tidsramme: Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
|
Kalibreringsytelsen til AI-genererte diagnostiske tillitsscore vurdert ved bruk av Forventet Kalibreringsfeil (ECE).
|
Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
|
|
Areal under mottakeroperasjonskarakteristikkkurven (AUC) og presisjon-gjenkallingskurven (PRC)
Tidsramme: Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
|
Areal under mottakeroperasjonskarakteristikk-kurven og presisjons-hentekurven for AI-diagnostisk klassifisering på tvers av sykdomskategorier.
|
Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
|
|
Tid-til-diagnose i samtalesimuleringer
Tidsramme: Ved fullføring av simuleringsevalueringer (opptil 6 måneder)
|
Antall samtalerunder som kreves av AI-systemet og kliniske deltakere for å nå en endelig diagnose i semi-syntetiske pasientsimuleringsscenarioer.
|
Ved fullføring av simuleringsevalueringer (opptil 6 måneder)
|
Samarbeidspartnere og etterforskere
Etterforskere
- Hovedetterforsker: Luis R Soenksen, MSE, PhD, Nolla Health
Studierekorddatoer
Studer hoveddatoer
Studiestart (Faktiske)
Primær fullføring (Antatt)
Studiet fullført (Antatt)
Datoer for studieregistrering
Først innsendt
Først innsendt som oppfylte QC-kriteriene
Først lagt ut (Faktiske)
Oppdateringer av studieposter
Sist oppdatering lagt ut (Faktiske)
Siste oppdatering sendt inn som oppfylte QC-kriteriene
Sist bekreftet
Mer informasjon
Begreper knyttet til denne studien
Nøkkelord
Andre studie-ID-numre
- NH-OSVDE-MSCNE-1026
Plan for individuelle deltakerdata (IPD)
Planlegger du å dele individuelle deltakerdata (IPD)?
IPD-planbeskrivelse
Legemiddel- og utstyrsinformasjon, studiedokumenter
Studerer et amerikansk FDA-regulert medikamentprodukt
Studerer et amerikansk FDA-regulert enhetsprodukt
Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .