- ICH GCP
- Register voor klinische proeven in de VS.
- Klinische proef NCT05272189
Project 3 Voorbeeld: Human-AI Collaboration Tester (HAICT) Exp. 7
Studie Overzicht
Toestand
Interventie / Behandeling
Gedetailleerde beschrijving
Deze tekst is de tekst van de pre-registratie voor het HAICT 7 experiment zoals beschreven op het Open Science Framework. https://osf.io/hngu4/
OPMERKING: Deze studie is representatief voor studies die zijn uitgevoerd in Project 3 van deze subsidie. Er zijn meerdere experimenten in de bundel experimenten die wordt weergegeven door Project 3, maar het is niet mogelijk om een bundel studies te registreren op CT.gov.
OPMERKING: aangezien de opmerking bij het voornaamwoord adviserend is, laten we het voorlopig staan.
Human-AI Collaboration Tester (HAICT) Exp. 7 (licht bewerkt vanuit OSF)
Gegevensverzameling. Zijn er al gegevens verzameld voor dit onderzoek? (Ja nee)
Ja
- Hypothese. Wat is de belangrijkste vraag die wordt gesteld of de hypothese die wordt getest in deze studie?
Achtergrond: In een verscheidenheid aan zoekexperimenten, zowel basis- als klinische, kwamen de gegevens overeen met een situatie waarin de variabiliteit van het signaal (of doelwit) groter is dan de variabiliteit van de ruis (afleiders). Het klassieke teken hiervan is een zROC-functie met een helling < 1 - meestal rond de 0,6. Een helling van 1,0 is indicatief voor een 2AFC-taak met gelijke variantie. Voor de HAICT-taak die we hebben getest, zouden we een gelijke variantie verwachten, maar we denken dat het de moeite waard is om te controleren, dus we zullen de prevalentie systematisch variëren, waardoor het criterium zal verschuiven. Dat zal een ROC-curve opleveren die we kunnen onderzoeken.
We zullen ook de nep-AI van Second Reader testen om te bepalen of een lage prevalentie Second Reader erger maakt.
- (H1): We verwachten de bevinding te repliceren dat menselijke criteria conservatiever worden naarmate de prevalentie afneemt.
- (H2): We voorspellen dat de helling van de resulterende zROC 1,0 zal zijn.
(H3): We veronderstellen dat een lage prevalentie Second Reader AI minder effectief zal maken omdat de positief voorspellende waarde van de commentaren laag zal zijn.
Afhankelijke variabele. Beschrijf de belangrijkste afhankelijke variabele(n) en specificeer hoe ze zullen worden gemeten.
De belangrijkste afhankelijke variabelen die van belang zijn, zijn nauwkeurigheid (en de signaaldetectiederivaten van nauwkeurigheid, d' en c), reactietijd en subjectieve beoordelingen op het onderzoek na elk blok.
- Voorwaarden. Aan hoeveel en aan welke voorwaarden worden deelnemers toegewezen?
Deze reeks experimenten onderzoekt hoe het veranderen van de invoer van een gesimuleerde AI de beslissingen kan beïnvloeden die door menselijke waarnemers worden genomen in een twee-alternatieve gedwongen keuzetaak (zoals de beslissing om een vrouw terug te roepen voor verder onderzoek in mammografie). We hebben een paradigma ontwikkeld, de Human-AI Collaboration Tester (HAICT), waarmee interacties tussen een mens en een gesimuleerde AI efficiënt kunnen worden getest.
De taak van de waarnemers is onder alle omstandigheden om een 2AFC-beslissing te geven over de vraag of een stimulus "slecht" of "niet slecht" is. Om taal te gebruiken die grofweg een medische diagnose nabootst, wordt elke stimulus een 'geval' genoemd. Waarnemers wordt gevraagd om een 2AFC-beslissing te nemen over reeksen gekleurde vormen. De beslissing wordt genomen op basis van de overheersende kleur van de behuizing. Het aantal elementen van elke kleur wordt ontleend aan een van de twee normale verdelingen, één voor positieve (slechte) stimuli en de andere voor negatieve (niet slechte) stimuli.
De resultaten van eerdere HAICT-experimenten (3 en 4) toonden aan dat menselijke prestaties in de Second Reader-conditie aanzienlijk afnemen bij een lage prevalentie. De prestatie in de Second Reader-conditie was beter dan Baseline wanneer de prevalentie van slechte gevallen 50% was, maar was significant slechter dan Baseline wanneer de prevalentie slechts 10% was. In dit experiment manipuleren we de prevalentie van "slechte" gevallen in de Second Reader- en Baseline-condities. Er worden vier verschillende prevalentiepercentages getest: 10%, 33%, 67% en 90%. Waarnemers voltooien 8 blokken (2 AI-regels x 4 prevalentiecijfers) en de blokvolgorde is willekeurig.
AI-regels die getest moeten worden:
- Baseline - Geen AI-invoer. Observer classificeert elk geval afzonderlijk als "slecht" of "niet" slecht.
Tweede lezer - De waarnemer neemt een eerste beslissing over elk geval. De AI classificeert stilletjes stimuli met behulp van een conservatief criterium (c = 0,5). De logica voor het conservatieve criterium is dat de tweede lezer wordt gebruikt om het aantal fout-positieve reacties te verminderen en dat het dus de bedoeling is om positieve menselijke reacties in twijfel te trekken die marginaal kunnen zijn. Als de waarnemer en AI het niet eens zijn, informeert de AI de menselijke waarnemer. De waarnemer krijgt dan de kans om zijn reactie te wijzigen of zijn eerste mening te volgen.
Net als in Experimenten 1-5 is de AI d-prime vastgesteld op 2,2. Van feedback is bekend dat het het prevalentie-effect vergroot, dus feedback zal zowel in de praktijk als in de testtrials worden gegeven. Waarnemers zullen in elk blok 20 oefenpogingen en 200 testpogingen voltooien. Onmiddellijk nadat elk blok is voltooid, krijgen waarnemers een samenvatting van hun prestaties te zien. Na de Second Reader-blokken wordt hen ook gevraagd om drie subjectieve vragen over het nut van de AI te beantwoorden (zie "Bestanden" voor meer details).
Analyses. Geef precies aan welke analyses je gaat uitvoeren om de hoofdvraag/hypothese te onderzoeken.
Eerst vatten we het aantal treffers, echte negatieven, missers en valse alarmen in elk blok samen. Hieruit kunnen we de nauwkeurigheid, de positief voorspellende waarde, de gevoeligheid (d-prime) en het criterium voor elke waarnemer onder elk van de verschillende omstandigheden berekenen. Gegeven prestatiemetingen op 4 prevalentieniveaus, kunnen we de ROC-curve (pHit x pFA) en de zROC-functie (zHit x zFA) schatten. We testen de hypothese dat de helling van de zROC gelijk is aan 1 (het gevolg van een 2AFC-taak met gelijke variantie).
Meer analyses. Secundaire analyses?
We zullen kijken of de subjectieve meningen van de waarnemers over de AI gecorreleerd zijn met variabelen zoals de empirische d-prime, of de positief voorspellende waarde.
Steekproefgrootte. Hoeveel waarnemingen worden er verzameld of wat bepaalt de steekproefomvang? U hoeft de beslissing niet te rechtvaardigen, maar wees precies hoe het aantal precies zal worden bepaald.
We zullen 12 waarnemers testen. Dit komt overeen met de steekproefomvang van eerdere experimenten.
- Ander. Is er nog iets dat u vooraf wilt aanmelden? (bijv. gegevensuitsluitingen, variabelen verzameld voor verkennende doeleinden, ongebruikelijke analyses gepland?)
NVT
Studietype
Inschrijving (Werkelijk)
Fase
- Niet toepasbaar
Contacten en locaties
Studie Locaties
-
-
Massachusetts
-
Boston, Massachusetts, Verenigde Staten, 02215
- Visual Attention Lab / Brigham and Women's Hospital
-
-
Deelname Criteria
Geschiktheidscriteria
Leeftijden die in aanmerking komen voor studie
Accepteert gezonde vrijwilligers
Beschrijving
Inclusiecriteria:
- - Iedereen welkom om online in te schrijven
Uitsluitingscriteria:
- Moet slagen voor de Ishihara-screeningtest voor kleurenzicht
- 20/25 zicht (met correctie)
Studie plan
Hoe is de studie opgezet?
Ontwerpdetails
- Primair doel: Fundamentele wetenschap
- Toewijzing: NVT
- Interventioneel model: Opdracht voor een enkele groep
- Masker: Geen (open label)
Wapens en interventies
Deelnemersgroep / Arm |
Interventie / Behandeling |
|---|---|
|
Experimenteel: Experiment
Alle deelnemers worden getest in alle omstandigheden van dit experiment.
|
In dit experiment neemt de deelnemer onder bepaalde omstandigheden zijn beslissing in aanwezigheid van informatie over een gesimuleerde kunstmatige intelligentiebeslissing.
De frequentie waarmee targets worden gepresenteerd varieert van 10% tot 90%
Andere namen:
|
Wat meet het onderzoek?
Primaire uitkomstmaten
Uitkomstmaat |
Maatregel Beschrijving |
Tijdsspanne |
|---|---|---|
|
D'
Tijdsspanne: Gegevens worden verzameld binnen een sessie van ongeveer een uur.
|
D' (d-prime) is de signaaldetectietheorie-maatstaf voor het prestatiepeil bij een taak.
Het wordt berekend door het aandeel van de juiste positieve reacties te bepalen = (juiste positieve proeven)/(juiste positieve + fout-negatieve proeven) = p(TP) en door het aandeel van de fout-positieve reacties te bepalen = (fout-positieve proeven)/(fout-positieve + juiste negatieve proeven) = p(FP).
Deze waarden worden omgezet in 'z-scores' (bijvoorbeeld met NORMSINV in Excel om de inverse van de standaardnormale verdeling te berekenen).
D' wordt gedefinieerd als Z(TP)-Z(FP).
Het bereik gaat van 0 voor gevallen waarin geen signaal kan worden onderscheiden van de ruis, tot ~4,0.
De bovengrens is niet gedefinieerd, maar 4 zou betekenen dat een waarnemer in wezen perfect is in het onderscheiden van signaal van ruis.
|
Gegevens worden verzameld binnen een sessie van ongeveer een uur.
|
|
Criterium
Tijdsspanne: De gegevens worden verzameld binnen een sessie van ongeveer een uur.
|
Criterium, zoals D' (zie hierboven) wordt berekend uit z(TP) en z(FP).
Criterium ( c ) = (z(TP)+z(FP))/-2.
Een waarde van nul betekent dat de waarnemer even waarschijnlijk een positieve (bijv.
'doelwit aanwezig') respons geeft als een negatieve (afwezige) respons.
Positieve waarden betekenen dat de waarnemer eerder geneigd is "afwezig" te zeggen (een "conservatief" criterium).
Negatieve waarden betekenen dat de waarnemer eerder geneigd is "aanwezig" te zeggen (een "liberaal" criterium).
Liberaal en conservatief hebben in dit geval geen politieke connotaties.
Criteriumwaarden vallen bijna altijd tussen -2 en 2.
|
De gegevens worden verzameld binnen een sessie van ongeveer een uur.
|
Secundaire uitkomstmaten
Uitkomstmaat |
Maatregel Beschrijving |
Tijdsspanne |
|---|---|---|
|
Reactietijd
Tijdsspanne: De gegevens worden verzameld binnen een sessie van ongeveer een uur.
|
Dit is de maatstaf voor hoe lang het duurt om een antwoord te geven.
|
De gegevens worden verzameld binnen een sessie van ongeveer een uur.
|
Medewerkers en onderzoekers
Sponsor
Medewerkers
Onderzoekers
- Hoofdonderzoeker: Jeremy M Wolfe, PhD, Brigham and Women's Hospital
Studie record data
Bestudeer belangrijke data
Studie start (Werkelijk)
Primaire voltooiing (Werkelijk)
Studie voltooiing (Werkelijk)
Studieregistratiedata
Eerst ingediend
Eerst ingediend dat voldeed aan de QC-criteria
Eerst geplaatst (Werkelijk)
Updates van studierecords
Laatste update geplaatst (Werkelijk)
Laatste update ingediend die voldeed aan QC-criteria
Laatst geverifieerd
Meer informatie
Termen gerelateerd aan deze studie
Trefwoorden
Aanvullende relevante MeSH-voorwaarden
Andere studie-ID-nummers
- 2007P000646-B
- R01CA207490 (Subsidie/contract van de Amerikaanse NIH)
Plan Individuele Deelnemersgegevens (IPD)
Bent u van plan om gegevens van individuele deelnemers (IPD) te delen?
Beschrijving IPD-plan
IPD-tijdsbestek voor delen
IPD-toegangscriteria voor delen
IPD delen Ondersteunend informatietype
- LEERPROTOCOOL
- SAP
- ICF
Informatie over medicijnen en apparaten, studiedocumenten
Bestudeert een door de Amerikaanse FDA gereguleerd geneesmiddel
Bestudeert een door de Amerikaanse FDA gereguleerd apparaatproduct
Deze informatie is zonder wijzigingen rechtstreeks van de website clinicaltrials.gov gehaald. Als u verzoeken heeft om uw onderzoeksgegevens te wijzigen, te verwijderen of bij te werken, neem dan contact op met register@clinicaltrials.gov. Zodra er een wijziging wordt doorgevoerd op clinicaltrials.gov, wordt deze ook automatisch bijgewerkt op onze website .