- ICH GCP
- Amerikanska kliniska prövningsregistret
- Klinisk prövning NCT07470463
Utvärdering av One-Shot Vision Differential Diagnosis (OSVDE) och Multi-Step Conversational Non-Inferiority (MSCNE) i AI-medicinsk intervjuteknik. (OSVDE-MSCNE)
Utvärdering av prestanda för AI-baserade medicinska intervju- och diagnossystem: One-Shot Vision Differential Diagnosis (OSVDE) och Multi-Step Conversational Non-Inferiority (MSCNE)-utvärdering.
Denna studie utvärderar den diagnostiska prestandan hos ett multimodal artificiellt intelligenssystem (AIMD.1) som använder avidentifierade medicinska bilder och semisyntetiska patientsimuleringar. Studien kombinerar retrospektiv analys av befintliga offentligt tillgängliga bilddatabaser med prospektiv datainsamling från specialister med specialistbevisning som genomför diagnostiska utvärderingsuppgifter.
I etappen för One-Shot Vision Differential Evaluation (OSVDE) granskar kliniker individuella avidentifierade medicinska bilder och genererar en rankad lista över potentiella diagnoser baserat enbart på visuella egenskaper. I etappen för Multi-Step Conversational Non-Inferiority Evaluation (MSCNE) genomför kliniker diagnostiska bedömningar med hjälp av semisyntetiska patientsimuleringar härledda från avidentifierade medicinska bilder. Klinikernas prestation kommer att jämföras med AI-systemet på samma diagnostiska uppgifter.
Mänskliga deltagare består enbart av specialister med specialistbevisning som tillhandahåller diagnostiska svar. Medicinska bilder och simulerade fall är studiematerial och betraktas inte som studieparticipanter. Ingen identifierbar patientdata används, och AI-systemet utvärderas i en offline forskningsmiljö och används inte för kliniska beslut eller patientvård.
Studieöversikt
Status
Betingelser
Intervention / Behandling
Detaljerad beskrivning
Artificiell intelligens (AI)-system har visat lovande förmågor inom medicinsk diagnostik; dock krävs rigorös benchmarkutvärdering före klinisk implementering. AIMD.1 är ett multimodalt AI-diagnossystem utformat för att assistera kliniskt resonemang genom analys av medicinska bilder och konversationella diagnostiska interaktioner.
Denna studie utvärderar AIMD.1:s diagnostiska prestanda med en kombination av retrospektiva bilddatabaser och prospektiva klinikerutvärderingsuppgifter. Syftet är att avgöra om AI-systemet uppnår diagnostisk noggrannhet jämförbar med specialister under kontrollerade benchmarkförhållanden.
Utvärderingen inkluderar två kompletterande stadier.
One-Shot Vision Differential Evaluation (OSVDE):
I detta skede granskar AI-systemet och kliniker deltagare oberoende enskilda de-identifierade medicinska bilder och genererar rankade listor av potentiella diagnoser enbart baserat på visuella egenskaper. Utvärderingen kommer att använda cirka 11 500–15 000 de-identifierade medicinska bilder över flera medicinska specialiteter och sjukdomskategorier med verifierade referensdiagnoser.
Multi-Step Conversational Non-Inferiority Evaluation (MSCNE):
I detta skede slutför AI-systemet och kliniker diagnostiska uppgifter med semi-syntetiska patientsimuleringar härledda från de-identifierade medicinska bilder. Dessa simuleringar tillhandahåller strukturerad klinisk information genom konversationella interaktioner, vilket möjliggör bedömning av diagnostiskt resonemang över flera steg. Cirka 380–500 simulerade fall kommer att utvärderas.
Cirka 10–30 specialister kommer att delta i studien. Kliniker kommer att slutföra diagnostiska utvärderingssessioner på distans och kommer att tillhandahålla differentialdiagnoser för delmängder av bild- och simuleringsfall. Mänskliga deltagare består enbart av kliniker som tillhandahåller diagnostiska svar. Bilddatabaserna och syntetiska fall fungerar som studiematerial och betraktas inte som deltagare.
Alla bilder som används i studien är de-identifierade och härstammar från offentligt tillgängliga källor eller databaser som uppfyller de-identifieringsstandarder. Ytterligare förbearbetningssteg säkerställer borttagning av eventuellt identifierbar information före inkludering i forskningsdatabasen.
AI-systemet utvärderas i en offline forskningsmiljö och används inte för att styra verklig klinisk vård eller patienthantering. Studien är utformad som en benchmarkprestandautvärdering före eventuell prospektiv validering som involverar verkliga patienter.
Primära utfallsmått inkluderar diagnostiska noggrannhetsmått såsom Top-1 diagnostisk noggrannhet, definierad som andelen fall där AI-systemets primära diagnos matchar referensdiagnosen. Sekundära utfall inkluderar Top-5 diagnostisk noggrannhet, kalibreringsmått, sensitivitet och specificitet över sjukdomskategorier, och tid-till-diagnos-mått i konversationella diagnostiska scenarier.
Dataanalys kommer att uppskatta diagnostisk noggrannhet med konfidensintervall och jämföra AI-systemets prestanda med klinikerprestanda med hjälp av parade statistiska tester och icke-underlägsenhetsanalyser.
Klinikersvar registreras med anonyma studieidentifierare, och endast aggregerade prestandaresultat kommer att rapporteras. Ingen identifierbar information om kliniker eller patienter kommer att samlas in eller publiceras.
Studiens varaktighet förväntas vara cirka sex månader, inklusive databasförberedelse, klinikerutvärderingssessioner och statistisk analys.
Protokoll-ID 1026 har verifierats som Undantagenlig enligt 45CFR46.104(d) Ex den 2026-03-10 av Solutions IRB (855) 226-4472 (www.solutionsirb.com)
Studietyp
Inskrivning (Beräknad)
Kontakter och platser
Studiekontakt
- Namn: Luis R Soenksen, MSE, PhD
- Telefonnummer: (617) 936-9293
- E-post: soenksen@nollahealth.com
Studera Kontakt Backup
- Namn: Sean Geiger, B.S.
- Telefonnummer: (412) 412-8786
- E-post: sean@nollahealth.com
Studieorter
-
-
New York
-
New York, New York, Förenta staterna, 10003
- Rekrytering
- Nolla Health (Magic Health Inc.)
-
Kontakt:
- Sean Geiger, B.S.
- Telefonnummer: (412) 412-8786
- E-post: sean@nollahealth.com
-
Kontakt:
- Luis R Soenksen, MSE, PhD
- Telefonnummer: (617)936-9293
- E-post: soenksen@nollahealth.com
-
Huvudutredare:
- Luis R Soenksen, MSE, PhD
-
Underutredare:
- Sean Geiger, B.S.
-
Underutredare:
- Luis Wenus
-
-
Deltagandekriterier
Urvalskriterier
Åldrar som är berättigade till studier
- Vuxen
- Äldre vuxen
Tar emot friska volontärer
Testmetod
Studera befolkning
Beskrivning
Inklusionskriterier:
- Aktiv specialistcertifiering inom Dermatologi, Internmedicin, Öron-näsa-hals, Gynekologi, Ortopedi, Pediatrik, Geriatrik, Akutsjukvård, Oftalmologi, Psykiatri, Endokrinologi, Allmänmedicin eller ett nära besläktat specialområde
- Ålder 18 år eller äldre
- Möjlighet att genomföra diagnostiska utvärderingssessioner på distans med dator eller surfplatta med tillförlitlig internetuppkoppling
Exklusionskriterier:
- Förlust av aktiv specialistcertifiering inom ett kvalificerande specialområde
- Oförmåga att genomföra utvärderingssessionen på distans
Studieplan
Hur är studien utformad?
Designdetaljer
Kohorter och interventioner
Grupp / Kohort |
Intervention / Behandling |
|---|---|
|
Kliniker Deltagare
Legitimerade kliniker som deltar i diagnostiska utvärderingsuppgifter med avidentifierade medicinska bilder och semi-syntetiska patientsimuleringar för att bedöma diagnostisk noggrannhet.
Kliniker tillhandahåller differentialdiagnoser för referensjämförelse med ett AI-diagnossystem.
|
AIMD.1 (även känd som NollaMD-agent) är ett multimodalt artificiellt intelligens (AI)-diagnossystem som är utformat för att generera differentialdiagnoser baserat på analys av medicinska bilder och strukturerad klinisk information.
I denna studie utvärderas systemet med avidentifierade medicinska bilder och semisyntetiska patientsimuleringar under kontrollerade forskningsförhållanden.
AI-systemet genererar rankade diagnostiska utdata och tillhörande konfidenspoäng, som jämförs med referensdiagnoser och klinikers prestationsmått.
Systemet utvärderas i en offline-forskningsmiljö.
AI-utdata används inte för kliniskt beslutsfattande, patienthantering eller verklig vård.
Andra namn:
|
Vad mäter studien?
Primära resultatmått
Resultatmått |
Åtgärdsbeskrivning |
Tidsram |
|---|---|---|
|
Topp-1 Diagnostisk Noggrannhet
Tidsram: Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)
|
Andel av utvärderade fall där den primära diagnosen som genererats av AI Diagnostic System matchar referensdiagnosen (ground truth).
Noggrannheten kommer att beräknas över avidentifierade medicinska bildfall och semisyntetiska patientsimuleringsfall och jämföras med klinikerprestation.
|
Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)
|
Sekundära resultatmått
Resultatmått |
Åtgärdsbeskrivning |
Tidsram |
|---|---|---|
|
Topp-5 Diagnostisk Noggrannhet
Tidsram: Vid avslutad diagnostisk utvärdering (upp till 6 månader)
|
Andel utvärderade fall där den korrekta referensdiagnosen förekommer inom de fem främst rankade diagnoserna som genereras av AI-diagnossystemet.
|
Vid avslutad diagnostisk utvärdering (upp till 6 månader)
|
|
Diagnostisk noggrannhet hos kliniska deltagare
Tidsram: Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)
|
Andel utvärderade fall där den kliniska deltagarens primära diagnos överensstämmer med referensdiagnosen, beräknad över tilldelade bild- och simuleringsfall.
|
Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)
|
|
AI:s diagnostiska noggrannhet är icke-underlägsen jämfört med kliniker
Tidsram: Vid avslutad diagnostisk utvärdering (upp till 6 månader)
|
Skillnad i Top-1 diagnostisk noggrannhet mellan AI-diagnossystemet och kliniker-deltagarna.
Icke-underlägsenhet kommer att bedömas med hjälp av en fördefinierad marginal på 5%.
|
Vid avslutad diagnostisk utvärdering (upp till 6 månader)
|
|
Kalibrering av AI-diagnostisk tillförlitlighet
Tidsram: Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)
|
Kalibreringsprestanda för AI-genererade diagnostiska konfidenspoäng utvärderade med Expected Calibration Error (ECE).
|
Vid slutförande av diagnostiska utvärderingar (upp till 6 månader)
|
|
Area Under the Receiver Operating Characteristic Curve (AUC) och Precision Recall Curve (PRC)
Tidsram: Vid slutförandet av diagnostiska utvärderingar (upp till 6 månader)
|
Area under the receiver operating characteristic curve and the Precision Recall Curve for AI diagnostic classification across disease categories.
|
Vid slutförandet av diagnostiska utvärderingar (upp till 6 månader)
|
|
Tid-till-diagnos i konversationssimuleringar
Tidsram: Vid slutförandet av simuleringsutvärderingar (upp till 6 månader)
|
Antal konversationsväxlingar som krävs av AI-systemet och kliniker-deltagarna för att nå en slutgiltig diagnos i semi-syntetiska patientsimuleringsfall.
|
Vid slutförandet av simuleringsutvärderingar (upp till 6 månader)
|
Samarbetspartners och utredare
Utredare
- Huvudutredare: Luis R Soenksen, MSE, PhD, Nolla Health
Studieavstämningsdatum
Studera stora datum
Studiestart (Faktisk)
Primärt slutförande (Beräknad)
Avslutad studie (Beräknad)
Studieregistreringsdatum
Först inskickad
Först inskickad som uppfyllde QC-kriterierna
Första postat (Faktisk)
Uppdateringar av studier
Senaste uppdatering publicerad (Faktisk)
Senaste inskickade uppdateringen som uppfyllde QC-kriterierna
Senast verifierad
Mer information
Termer relaterade till denna studie
Nyckelord
Andra studie-ID-nummer
- NH-OSVDE-MSCNE-1026
Plan för individuella deltagardata (IPD)
Planerar du att dela individuella deltagardata (IPD)?
IPD-planbeskrivning
Läkemedels- och apparatinformation, studiedokument
Studerar en amerikansk FDA-reglerad läkemedelsprodukt
Studerar en amerikansk FDA-reglerad produktprodukt
Denna information hämtades direkt från webbplatsen clinicaltrials.gov utan några ändringar. Om du har några önskemål om att ändra, ta bort eller uppdatera dina studieuppgifter, vänligen kontakta register@clinicaltrials.gov. Så snart en ändring har implementerats på clinicaltrials.gov, kommer denna att uppdateras automatiskt även på vår webbplats .