Denna sida har översatts automatiskt och översättningens korrekthet kan inte garanteras. Vänligen se engelsk version för en källtext.

Utvärdering av One-Shot Vision Differential Diagnosis (OSVDE) och Multi-Step Conversational Non-Inferiority (MSCNE) i AI-medicinsk intervjuteknik. (OSVDE-MSCNE)

20 mars 2026 uppdaterad av: Magic Health Inc. (d.b.a. Nolla Health)

Utvärdering av prestanda för AI-baserade medicinska intervju- och diagnossystem: One-Shot Vision Differential Diagnosis (OSVDE) och Multi-Step Conversational Non-Inferiority (MSCNE)-utvärdering.

Denna studie utvärderar den diagnostiska prestandan hos ett multimodal artificiellt intelligenssystem (AIMD.1) som använder avidentifierade medicinska bilder och semisyntetiska patientsimuleringar. Studien kombinerar retrospektiv analys av befintliga offentligt tillgängliga bilddatabaser med prospektiv datainsamling från specialister med specialistbevisning som genomför diagnostiska utvärderingsuppgifter.

I etappen för One-Shot Vision Differential Evaluation (OSVDE) granskar kliniker individuella avidentifierade medicinska bilder och genererar en rankad lista över potentiella diagnoser baserat enbart på visuella egenskaper. I etappen för Multi-Step Conversational Non-Inferiority Evaluation (MSCNE) genomför kliniker diagnostiska bedömningar med hjälp av semisyntetiska patientsimuleringar härledda från avidentifierade medicinska bilder. Klinikernas prestation kommer att jämföras med AI-systemet på samma diagnostiska uppgifter.

Mänskliga deltagare består enbart av specialister med specialistbevisning som tillhandahåller diagnostiska svar. Medicinska bilder och simulerade fall är studiematerial och betraktas inte som studieparticipanter. Ingen identifierbar patientdata används, och AI-systemet utvärderas i en offline forskningsmiljö och används inte för kliniska beslut eller patientvård.

Studieöversikt

Status

Rekrytering

Detaljerad beskrivning

Artificiell intelligens (AI)-system har visat lovande förmågor inom medicinsk diagnostik; dock krävs rigorös benchmarkutvärdering före klinisk implementering. AIMD.1 är ett multimodalt AI-diagnossystem utformat för att assistera kliniskt resonemang genom analys av medicinska bilder och konversationella diagnostiska interaktioner.

Denna studie utvärderar AIMD.1:s diagnostiska prestanda med en kombination av retrospektiva bilddatabaser och prospektiva klinikerutvärderingsuppgifter. Syftet är att avgöra om AI-systemet uppnår diagnostisk noggrannhet jämförbar med specialister under kontrollerade benchmarkförhållanden.

Utvärderingen inkluderar två kompletterande stadier.

One-Shot Vision Differential Evaluation (OSVDE):

I detta skede granskar AI-systemet och kliniker deltagare oberoende enskilda de-identifierade medicinska bilder och genererar rankade listor av potentiella diagnoser enbart baserat på visuella egenskaper. Utvärderingen kommer att använda cirka 11 500–15 000 de-identifierade medicinska bilder över flera medicinska specialiteter och sjukdomskategorier med verifierade referensdiagnoser.

Multi-Step Conversational Non-Inferiority Evaluation (MSCNE):

I detta skede slutför AI-systemet och kliniker diagnostiska uppgifter med semi-syntetiska patientsimuleringar härledda från de-identifierade medicinska bilder. Dessa simuleringar tillhandahåller strukturerad klinisk information genom konversationella interaktioner, vilket möjliggör bedömning av diagnostiskt resonemang över flera steg. Cirka 380–500 simulerade fall kommer att utvärderas.

Cirka 10–30 specialister kommer att delta i studien. Kliniker kommer att slutföra diagnostiska utvärderingssessioner på distans och kommer att tillhandahålla differentialdiagnoser för delmängder av bild- och simuleringsfall. Mänskliga deltagare består enbart av kliniker som tillhandahåller diagnostiska svar. Bilddatabaserna och syntetiska fall fungerar som studiematerial och betraktas inte som deltagare.

Alla bilder som används i studien är de-identifierade och härstammar från offentligt tillgängliga källor eller databaser som uppfyller de-identifieringsstandarder. Ytterligare förbearbetningssteg säkerställer borttagning av eventuellt identifierbar information före inkludering i forskningsdatabasen.

AI-systemet utvärderas i en offline forskningsmiljö och används inte för att styra verklig klinisk vård eller patienthantering. Studien är utformad som en benchmarkprestandautvärdering före eventuell prospektiv validering som involverar verkliga patienter.

Primära utfallsmått inkluderar diagnostiska noggrannhetsmått såsom Top-1 diagnostisk noggrannhet, definierad som andelen fall där AI-systemets primära diagnos matchar referensdiagnosen. Sekundära utfall inkluderar Top-5 diagnostisk noggrannhet, kalibreringsmått, sensitivitet och specificitet över sjukdomskategorier, och tid-till-diagnos-mått i konversationella diagnostiska scenarier.

Dataanalys kommer att uppskatta diagnostisk noggrannhet med konfidensintervall och jämföra AI-systemets prestanda med klinikerprestanda med hjälp av parade statistiska tester och icke-underlägsenhetsanalyser.

Klinikersvar registreras med anonyma studieidentifierare, och endast aggregerade prestandaresultat kommer att rapporteras. Ingen identifierbar information om kliniker eller patienter kommer att samlas in eller publiceras.

Studiens varaktighet förväntas vara cirka sex månader, inklusive databasförberedelse, klinikerutvärderingssessioner och statistisk analys.

Protokoll-ID 1026 har verifierats som Undantagenlig enligt 45CFR46.104(d) Ex den 2026-03-10 av Solutions IRB (855) 226-4472 (www.solutionsirb.com)

Studietyp

Observationell

Inskrivning (Beräknad)

30

Kontakter och platser

Det här avsnittet innehåller kontaktuppgifter för dem som genomför studien och information om var denna studie genomförs.

Studiekontakt

Studera Kontakt Backup

Studieorter

    • New York
      • New York, New York, Förenta staterna, 10003
        • Rekrytering
        • Nolla Health (Magic Health Inc.)
        • Kontakt:
        • Kontakt:
        • Huvudutredare:
          • Luis R Soenksen, MSE, PhD
        • Underutredare:
          • Sean Geiger, B.S.
        • Underutredare:
          • Luis Wenus

Deltagandekriterier

Forskare letar efter personer som passar en viss beskrivning, så kallade behörighetskriterier. Några exempel på dessa kriterier är en persons allmänna hälsotillstånd eller tidigare behandlingar.

Urvalskriterier

Åldrar som är berättigade till studier

  • Vuxen
  • Äldre vuxen

Tar emot friska volontärer

Ja

Testmetod

Icke-sannolikhetsprov

Studera befolkning

Studiepopulationen består av legitimerade läkare över flera medicinska specialiteter som deltar i diagnostiska utvärderingsuppgifter med avidentifierade medicinska bilder och semisyntetiska patientsimuleringar. Deltagare rekryteras genom professionella nätverk och medicinska föreningar. Inga patienter ingår i denna studie.

Beskrivning

Inklusionskriterier:

  • Aktiv specialistcertifiering inom Dermatologi, Internmedicin, Öron-näsa-hals, Gynekologi, Ortopedi, Pediatrik, Geriatrik, Akutsjukvård, Oftalmologi, Psykiatri, Endokrinologi, Allmänmedicin eller ett nära besläktat specialområde
  • Ålder 18 år eller äldre
  • Möjlighet att genomföra diagnostiska utvärderingssessioner på distans med dator eller surfplatta med tillförlitlig internetuppkoppling

Exklusionskriterier:

  • Förlust av aktiv specialistcertifiering inom ett kvalificerande specialområde
  • Oförmåga att genomföra utvärderingssessionen på distans

Studieplan

Det här avsnittet ger detaljer om studieplanen, inklusive hur studien är utformad och vad studien mäter.

Hur är studien utformad?

Designdetaljer

Kohorter och interventioner

Grupp / Kohort
Intervention / Behandling
Kliniker Deltagare
Legitimerade kliniker som deltar i diagnostiska utvärderingsuppgifter med avidentifierade medicinska bilder och semi-syntetiska patientsimuleringar för att bedöma diagnostisk noggrannhet. Kliniker tillhandahåller differentialdiagnoser för referensjämförelse med ett AI-diagnossystem.
AIMD.1 (även känd som NollaMD-agent) är ett multimodalt artificiellt intelligens (AI)-diagnossystem som är utformat för att generera differentialdiagnoser baserat på analys av medicinska bilder och strukturerad klinisk information. I denna studie utvärderas systemet med avidentifierade medicinska bilder och semisyntetiska patientsimuleringar under kontrollerade forskningsförhållanden. AI-systemet genererar rankade diagnostiska utdata och tillhörande konfidenspoäng, som jämförs med referensdiagnoser och klinikers prestationsmått. Systemet utvärderas i en offline-forskningsmiljö. AI-utdata används inte för kliniskt beslutsfattande, patienthantering eller verklig vård.
Andra namn:
  • Artificiell Intelligens Differentiell Diagnossystem
  • AI-baserat kliniskt beslutsstödssystem
  • AI-konversationellt kliniskt system
  • NollaMD

Vad mäter studien?

Primära resultatmått

Resultatmått
Åtgärdsbeskrivning
Tidsram
Topp-1 Diagnostisk Noggrannhet
Tidsram: Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)
Andel av utvärderade fall där den primära diagnosen som genererats av AI Diagnostic System matchar referensdiagnosen (ground truth). Noggrannheten kommer att beräknas över avidentifierade medicinska bildfall och semisyntetiska patientsimuleringsfall och jämföras med klinikerprestation.
Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)

Sekundära resultatmått

Resultatmått
Åtgärdsbeskrivning
Tidsram
Topp-5 Diagnostisk Noggrannhet
Tidsram: Vid avslutad diagnostisk utvärdering (upp till 6 månader)
Andel utvärderade fall där den korrekta referensdiagnosen förekommer inom de fem främst rankade diagnoserna som genereras av AI-diagnossystemet.
Vid avslutad diagnostisk utvärdering (upp till 6 månader)
Diagnostisk noggrannhet hos kliniska deltagare
Tidsram: Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)
Andel utvärderade fall där den kliniska deltagarens primära diagnos överensstämmer med referensdiagnosen, beräknad över tilldelade bild- och simuleringsfall.
Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)
AI:s diagnostiska noggrannhet är icke-underlägsen jämfört med kliniker
Tidsram: Vid avslutad diagnostisk utvärdering (upp till 6 månader)
Skillnad i Top-1 diagnostisk noggrannhet mellan AI-diagnossystemet och kliniker-deltagarna. Icke-underlägsenhet kommer att bedömas med hjälp av en fördefinierad marginal på 5%.
Vid avslutad diagnostisk utvärdering (upp till 6 månader)
Kalibrering av AI-diagnostisk tillförlitlighet
Tidsram: Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)
Kalibreringsprestanda för AI-genererade diagnostiska konfidenspoäng utvärderade med Expected Calibration Error (ECE).
Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)
Area Under the Receiver Operating Characteristic Curve (AUC) och Precision Recall Curve (PRC)
Tidsram: Vid slutförandet av diagnostiska utvärderingar (upp till 6 månader)
Area under the receiver operating characteristic curve and the Precision Recall Curve for AI diagnostic classification across disease categories.
Vid slutförandet av diagnostiska utvärderingar (upp till 6 månader)
Tid-till-diagnos i konversationssimuleringar
Tidsram: Vid slutförandet av simuleringsutvärderingar (upp till 6 månader)
Antal konversationsväxlingar som krävs av AI-systemet och kliniker-deltagarna för att nå en slutgiltig diagnos i semi-syntetiska patientsimuleringsfall.
Vid slutförandet av simuleringsutvärderingar (upp till 6 månader)

Samarbetspartners och utredare

Det är här du hittar personer och organisationer som är involverade i denna studie.

Utredare

  • Huvudutredare: Luis R Soenksen, MSE, PhD, Nolla Health

Studieavstämningsdatum

Dessa datum spårar framstegen för inlämningar av studieposter och sammanfattande resultat till ClinicalTrials.gov. Studieposter och rapporterade resultat granskas av National Library of Medicine (NLM) för att säkerställa att de uppfyller specifika kvalitetskontrollstandarder innan de publiceras på den offentliga webbplatsen.

Studera stora datum

Studiestart (Faktisk)

19 mars 2026

Primärt slutförande (Beräknad)

19 september 2026

Avslutad studie (Beräknad)

19 september 2026

Studieregistreringsdatum

Först inskickad

10 mars 2026

Först inskickad som uppfyllde QC-kriterierna

10 mars 2026

Första postat (Faktisk)

13 mars 2026

Uppdateringar av studier

Senaste uppdatering publicerad (Faktisk)

25 mars 2026

Senaste inskickade uppdateringen som uppfyllde QC-kriterierna

20 mars 2026

Senast verifierad

1 mars 2026

Mer information

Termer relaterade till denna studie

Plan för individuella deltagardata (IPD)

Planerar du att dela individuella deltagardata (IPD)?

NEJ

IPD-planbeskrivning

Individuella deltagardata kommer inte att delas. Studien omfattar avidentifierade medicinska bilder och anonyma klinikers diagnostiska svar. Endast aggregerade sammanfattande resultat (t.ex. diagnostisk noggrannhet och statistiska analyser) kommer att rapporteras i publikationer och presentationer.

Läkemedels- och apparatinformation, studiedokument

Studerar en amerikansk FDA-reglerad läkemedelsprodukt

Nej

Studerar en amerikansk FDA-reglerad produktprodukt

Nej

Denna information hämtades direkt från webbplatsen clinicaltrials.gov utan några ändringar. Om du har några önskemål om att ändra, ta bort eller uppdatera dina studieuppgifter, vänligen kontakta register@clinicaltrials.gov. Så snart en ändring har implementerats på clinicaltrials.gov, kommer denna att uppdateras automatiskt även på vår webbplats .

Prenumerera