Denne siden ble automatisk oversatt og nøyaktigheten av oversettelsen er ikke garantert. Vennligst referer til engelsk versjon for en kildetekst.

Evaluering av One-Shot Vision Differential Diagnosis (OSVDE) og Multi-Step Conversational Non-Inferiority (MSCNE) i AI-medisinske intervjuer. (OSVDE-MSCNE)

20. mars 2026 oppdatert av: Magic Health Inc. (d.b.a. Nolla Health)

Evaluering av AI-medisinsk intervju- og diagnostiseringssystemets ytelse: One-Shot Vision Differensialdiagnose (OSVDE) og Multi-Step Conversational Non-Inferiority (MSCNE) evaluering.

Denne studien evaluerer den diagnostiske ytelsen til et multimodal kunstig intelligens (AI)-system (AIMD.1) som bruker avidentifiserte medisinske bilder og semisyntetiske pasientsimuleringer. Studien kombinerer retrospektiv analyse av eksisterende offentlig tilgjengelige bildedatasett med prospektiv datainnsamling fra spesialister med godkjenning som fullfører diagnostiske evalueringsoppgaver.

I One-Shot Vision Differential Evaluation (OSVDE)-fasen vurderer spesialistene individuelle avidentifiserte medisinske bilder og genererer en rangert liste over mulige diagnoser utelukkende basert på visuelle trekk. I Multi-Step Conversational Non-Inferiority Evaluation (MSCNE)-fasen fullfører spesialistene diagnostiske vurderinger ved hjelp av semisyntetiske pasientsimuleringer utledet fra avidentifiserte medisinske bilder. Spesialistenes ytelse vil bli sammenlignet med AI-systemet på de samme diagnostiske oppgavene.

Menneskelige deltakere består utelukkende av spesialister med godkjenning som gir diagnostiske svar. Medisinske bilder og simulerte tilfeller er studiemateriale og regnes ikke som studiedeltakere. Ingen identifiserbare pasientdata brukes, og AI-systemet evalueres i en offline forskningsmiljø og brukes ikke til klinisk beslutningstaking eller pasientbehandling.

Studieoversikt

Detaljert beskrivelse

Kunstig intelligens (AI)-systemer har vist lovende evner i medisinsk diagnostikk; imidlertid er streng benchmark-evaluering nødvendig før klinisk implementering. AIMD.1 er et multimodal AI-diagnostisksystem designet for å assistere med klinisk resonnement gjennom analyse av medisinske bilder og konversasjonelle diagnostiske interaksjoner.

Denne studien evaluerer den diagnostiske ytelsen til AIMD.1 ved bruk av en kombinasjon av retrospektive bildedatasett og prospektive klinikerevalueringsoppgaver. Målet er å fastslå om AI-systemet oppnår diagnostisk nøyaktighet sammenlignbar med godkjente klinikere under kontrollerte benchmark-forhold.

Evalueringen inkluderer to komplementære stadier.

One-Shot Vision Differential Evaluation (OSVDE):

I dette stadiet vurderer AI-systemet og klinikerdeltakerne uavhengig individuelle de-identifiserte medisinske bilder og genererer rangert liste over potensielle diagnoser utelukkende basert på visuelle trekk. Evalueringen vil bruke omtrent 11 500–15 000 de-identifiserte medisinske bilder fra flere medisinske spesialiteter og sykdomskategorier med verifiserte referansediagnoser.

Multi-Step Conversational Non-Inferiority Evaluation (MSCNE):

I dette stadiet fullfører AI-systemet og klinikere diagnostiske oppgaver ved bruk av semisyntetiske pasientsimuleringer avledet fra de-identifiserte medisinske bilder. Disse simuleringene gir strukturert klinisk informasjon gjennom konversasjonelle interaksjoner, noe som muliggjør vurdering av diagnostisk resonnement over flere trinn. Omtrent 380–500 simulerte tilfeller vil bli evaluert.

Omtrent 10–30 godkjente klinikere vil delta i studien. Klinikere vil fullføre diagnostiske evalueringsøkter eksternt og vil gi differensialdiagnoser for delmengder av bildene og simuleringscasene. Menneskelige deltakere består utelukkende av klinikere som gir diagnostiske svar. Bildedatasettene og de syntetiske casene fungerer som studiemateriale og regnes ikke som deltakere.

Alle bilder brukt i studien er de-identifiserte og stammer fra offentlig tilgjengelige kilder eller datasett som oppfyller de-identifiseringsstandarder. Ytterligere forbehandlingstrinn sikrer fjerning av potensielt identifiserbar informasjon før inkludering i forskningsdatasettet.

AI-systemet evalueres i en offline forskningsmiljø og brukes ikke til å veilede virkelig klinisk omsorg eller pasientbehandling. Studien er designet som en benchmark-ytelsesevaluering før eventuell prospektiv validering som involverer ekte pasienter.

Primære utfallsmål inkluderer diagnostiske nøyaktighetsmål som Top-1 diagnostisk nøyaktighet, definert som andelen tilfeller der AI-systemets primærdiagnose samsvarer med referansediagnosen. Sekundære utfall inkluderer Top-5 diagnostisk nøyaktighet, kalibreringsmål, sensitivitet og spesifisitet på tvers av sykdomskategorier, og tid-til-diagnose-mål i konversasjonelle diagnostiske scenarier.

Dataanalyse vil estimere diagnostisk nøyaktighet med konfidensintervaller og sammenligne AI-systemets ytelse med klinikerytelse ved bruk av parrede statistiske tester og ikke-underlegenhetsanalyser.

Klinikersvar registreres ved bruk av anonyme studieidentifikatorer, og kun aggregerte ytelsesresultater vil rapporteres. Ingen identifiserbar informasjon om klinikere eller pasienter vil bli samlet inn eller publisert.

Studievarigheten forventes å være omtrent seks måneder, inkludert datasettforberedelse, klinikerevalueringsøkter og statistisk analyse.

Protokoll-ID 1026 er bekreftet som Unntatt i henhold til 45CFR46.104(d) Ex den 03.10.2026 av Solutions IRB (855) 226-4472 (www.solutionsirb.com)

Studietype

Observasjonsmessig

Registrering (Antatt)

30

Kontakter og plasseringer

Denne delen inneholder kontaktinformasjon for de som utfører studien, og informasjon om hvor denne studien blir utført.

Studiekontakt

Studer Kontakt Backup

Studiesteder

    • New York
      • New York, New York, Forente stater, 10003
        • Rekruttering
        • Nolla Health (Magic Health Inc.)
        • Ta kontakt med:
        • Ta kontakt med:
        • Hovedetterforsker:
          • Luis R Soenksen, MSE, PhD
        • Underetterforsker:
          • Sean Geiger, B.S.
        • Underetterforsker:
          • Luis Wenus

Deltakelseskriterier

Forskere ser etter personer som passer til en bestemt beskrivelse, kalt kvalifikasjonskriterier. Noen eksempler på disse kriteriene er en persons generelle helsetilstand eller tidligere behandlinger.

Kvalifikasjonskriterier

Alder som er kvalifisert for studier

  • Voksen
  • Eldre voksen

Tar imot friske frivillige

Ja

Prøvetakingsmetode

Ikke-sannsynlighetsprøve

Studiepopulasjon

Studiepopulasjonen består av spesialister med godkjenning fra spesialistnemnda innen flere medisinske spesialiteter, som deltar i diagnostiske vurderingsoppgaver ved bruk av anonymiserte medisinske bilder og semi-syntetiske pasientsimuleringer. Deltakere rekrutteres gjennom profesjonelle nettverk og medisinske foreninger. Ingen pasienter er inkludert i denne studien.

Beskrivelse

Inklusjonskriterier:

  • Aktiv spesialistgodkjenning i Dermatologi, Indremedisin, Øre-nese-hals, Gynekologi, Ortopedi, Pediatri, Geriatri, Akuttmedisin, Oftalmologi, Psykiatri, Endokrinologi, Allmennmedisin eller et nært beslektet spesialområde
  • 18 år eller eldre
  • Evne til å fullføre diagnostiske evalueringsøkter på nett ved hjelp av en datamaskin eller nettbrett med pålitelig internettilgang

Eksklusjonskriterier:

  • Mistet aktiv spesialistgodkjenning i et kvalifiserende spesialområde
  • Ute av stand til å fullføre evalueringsøkten på nett

Studieplan

Denne delen gir detaljer om studieplanen, inkludert hvordan studien er utformet og hva studien måler.

Hvordan er studiet utformet?

Designdetaljer

Kohorter og intervensjoner

Gruppe / Kohort
Intervensjon / Behandling
Kliniker Deltakere
Lisensierte klinikere som deltar i diagnostiske evalueringsoppgaver ved bruk av de-identifiserte medisinske bilder og semi-syntetiske pasientsimuleringer for å vurdere diagnostisk nøyaktighet. Klinikere gir differensialdiagnoser for sammenligning med et AI-diagnostisksystem.
AIMD.1 (også kjent som NollaMD-agent) er et multimodal kunstig intelligens (KI)-diagnostiseringssystem designet for å generere differensialdiagnoser basert på analyse av medisinske bilder og strukturert klinisk informasjon. I denne studien evalueres systemet ved bruk av anonymiserte medisinske bilder og semi-syntetiske pasientsimuleringer under kontrollerte forskningsforhold. KI-systemet genererer rangert diagnostisk utdata og tilhørende konfidensscore, som sammenlignes med referansediagnoser og klinikerprestasjonsmål. Systemet evalueres i en offline forskningsmiljø. KI-utdata brukes ikke til klinisk beslutningstaking, pasienthåndtering eller faktisk medisinsk behandling.
Andre navn:
  • Kunstig Intelligens Differensialdiagnostisk System
  • AI-klinisk beslutningsstøttesystem
  • AI Konversasjonell Klinisk System
  • NollaMD

Hva måler studien?

Primære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
Topp-1 Diagnostisk Nøyaktighet
Tidsramme: Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
Andel evaluerte tilfeller der primærdiagnosen generert av AI-diagnostisksystemet samsvarer med referansediagnosen (ground truth). Nøyaktighet vil bli beregnet over anonymiserte medisinske bildetilfeller og semi-syntetiske pasientsimuleringstilfeller og sammenlignet med klinikerprestasjoner.
Ved fullføring av diagnostiske utredninger (opptil 6 måneder)

Sekundære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
Topp-5 Diagnostisk Nøyaktighet
Tidsramme: Ved fullføring av diagnostiske evalueringer (opptil 6 måneder)
Andel evaluerte tilfeller der den korrekte referansediagnosen vises blant de fem øverst rangerte diagnosene generert av AI-diagnosesystemet.
Ved fullføring av diagnostiske evalueringer (opptil 6 måneder)
Diagnostisk nøyaktighet hos klinikerdeltakere
Tidsramme: Ved fullføring av diagnostiske evalueringer (opptil 6 måneder)
Andel evaluerte tilfeller der klinikerens primærdiagnose samsvarer med referansediagnosen, beregnet over tildelte bilder og simulerte tilfeller.
Ved fullføring av diagnostiske evalueringer (opptil 6 måneder)
Ikke-underlegenhet av AI-diagnostisk nøyaktighet sammenlignet med klinikere
Tidsramme: Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
Forskjell i Top-1 diagnostisk nøyaktighet mellom AI-diagnosesystemet og kliniker-deltakerne. Ikke-underlegenhet vil bli vurdert ved hjelp av en forhåndsdefinert margin på 5%.
Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
Kalibrering av AI-diagnostisk konfidens
Tidsramme: Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
Kalibreringsytelsen til AI-genererte diagnostiske tillitsscore vurdert ved bruk av Forventet Kalibreringsfeil (ECE).
Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
Areal under mottakeroperasjonskarakteristikkkurven (AUC) og presisjon-gjenkallingskurven (PRC)
Tidsramme: Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
Areal under mottakeroperasjonskarakteristikk-kurven og presisjons-hentekurven for AI-diagnostisk klassifisering på tvers av sykdomskategorier.
Ved fullføring av diagnostiske utredninger (opptil 6 måneder)
Tid-til-diagnose i samtalesimuleringer
Tidsramme: Ved fullføring av simuleringsevalueringer (opptil 6 måneder)
Antall samtalerunder som kreves av AI-systemet og kliniske deltakere for å nå en endelig diagnose i semi-syntetiske pasientsimuleringsscenarioer.
Ved fullføring av simuleringsevalueringer (opptil 6 måneder)

Samarbeidspartnere og etterforskere

Det er her du vil finne personer og organisasjoner som er involvert i denne studien.

Etterforskere

  • Hovedetterforsker: Luis R Soenksen, MSE, PhD, Nolla Health

Studierekorddatoer

Disse datoene sporer fremdriften for innsending av studieposter og sammendragsresultater til ClinicalTrials.gov. Studieposter og rapporterte resultater gjennomgås av National Library of Medicine (NLM) for å sikre at de oppfyller spesifikke kvalitetskontrollstandarder før de legges ut på det offentlige nettstedet.

Studer hoveddatoer

Studiestart (Faktiske)

19. mars 2026

Primær fullføring (Antatt)

19. september 2026

Studiet fullført (Antatt)

19. september 2026

Datoer for studieregistrering

Først innsendt

10. mars 2026

Først innsendt som oppfylte QC-kriteriene

10. mars 2026

Først lagt ut (Faktiske)

13. mars 2026

Oppdateringer av studieposter

Sist oppdatering lagt ut (Faktiske)

25. mars 2026

Siste oppdatering sendt inn som oppfylte QC-kriteriene

20. mars 2026

Sist bekreftet

1. mars 2026

Mer informasjon

Begreper knyttet til denne studien

Plan for individuelle deltakerdata (IPD)

Planlegger du å dele individuelle deltakerdata (IPD)?

NEI

IPD-planbeskrivelse

Individuelle deltakerdata vil ikke deles. Studien involverer avidentifiserte medisinske bilder og anonyme klinikerdiagnostiske svar. Kun aggregerte sammenfattende resultater (f.eks. diagnostisk nøyaktighet og statistiske analyser) vil bli rapportert i publikasjoner og presentasjoner.

Legemiddel- og utstyrsinformasjon, studiedokumenter

Studerer et amerikansk FDA-regulert medikamentprodukt

Nei

Studerer et amerikansk FDA-regulert enhetsprodukt

Nei

Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .

Abonnere