- ICH GCP
- US Clinical Trials Registry
- Klinisk utprøving NCT05272189
Prosjekt 3 Eksempel: Human-AI Collaboration Tester (HAICT) Exp. 7
Studieoversikt
Status
Intervensjon / Behandling
Detaljert beskrivelse
Denne teksten er teksten til forhåndsregistreringen for HAICT 7-eksperimentet som beskrevet på Open Science Framework. https://osf.io/hngu4/
MERK: Denne studien er representativ for studier utført i prosjekt 3 av denne bevilgningen. Det er flere eksperimenter i bunten av eksperimenter representert av prosjekt 3, men det er ikke mulig å registrere en bunt med studier på CT.gov.
MERK: Siden pronomenkommentaren er rådgivende, lar vi den stå for nå.
Human-AI Collaboration Tester (HAICT) Exp. 7 (lett redigert fra OSF)
Datainnsamling. Er det allerede samlet inn noen data for denne studien? (Ja Nei)
ja
- Hypotese. Hva er hovedspørsmålet eller hypotesen som testes i denne studien?
Bakgrunn: I en rekke søkeeksperimenter, både grunnleggende og kliniske, har dataene vært konsistente med en situasjon der variasjonen til signalet (eller målet) er større enn variasjonen til støyen (distraksjoner). Det klassiske tegnet på dette er en zROC-funksjon med en helning < 1 - typisk rundt 0,6. En helning på 1,0 er en indikasjon på en 2AFC-oppgave med lik varians. For HAICT-oppgaven som vi har testet, ville vi forvente lik varians, men vi tror det vil være verdt å sjekke, så vi vil systematisk variere prevalensen som vil skifte kriterium. Det vil feie ut en ROC-kurve som vi kan undersøke.
Vi vil også teste Second Reader faux-AI for å finne ut om lav prevalens gjør Second Reader verre.
- (H1): Vi forventer å gjenskape funnet om at menneskelige kriterier blir mer konservative ettersom prevalensen avtar.
- (H2): Vi spår at helningen til den resulterende zROC vil være 1,0.
(H3): Vi antar at lav prevalens vil gjøre Second Reader AI mindre effektiv fordi den positive prediktive verdien av kommentarene vil være lav.
Avhengig variabel. Beskriv nøkkelavhengige variabler og spesifisere hvordan de vil bli målt.
De viktigste avhengige variablene av interesse er nøyaktighet (og signaldeteksjonsderivatene av nøyaktighet, d' og c), reaksjonstid og subjektive vurderinger på undersøkelsen etter hver blokk.
- Forhold. Hvor mange og hvilke betingelser vil deltakerne bli tildelt?
Denne serien med eksperimenter undersøker hvordan endring av input fra en simulert AI kan påvirke avgjørelsene tatt av menneskelige observatører i en to-alternativ tvangsvalgoppgave (som beslutningen om å tilbakekalle en kvinne for videre undersøkelse i mammografi). Vi har utviklet et paradigme kalt Human-AI Collaboration Tester (HAICT) som muliggjør effektiv testing av interaksjoner mellom et menneske og en simulert AI.
Observatørenes oppgave under alle forhold er å gi en 2AFC-avgjørelse om hvorvidt en stimulus er "dårlig" eller "ikke dårlig." For å bruke språk som grovt etterligner en medisinsk diagnose, blir hver stimulus referert til som et "tilfelle". Observatører blir bedt om å ta en 2AFC-beslutning om matriser av fargede former. Avgjørelsen treffes ut fra sakens dominerende farge. Antall elementer i hver farge er trukket fra en av to normalfordelinger, en for positive (dårlige) stimuli og den andre for negative (ikke dårlige) stimuli.
Resultatene fra tidligere HAICT-eksperimenter (3 og 4) viste at menneskelig ytelse i Second Reader-tilstanden avtar betydelig ved lav prevalens. Ytelsen i Second Reader-tilstanden var bedre enn baseline når prevalensen av dårlige tilfeller var 50 %, men var signifikant dårligere enn baseline når prevalensen bare var 10 %. I dette eksperimentet manipulerer vi utbredelsen av "dårlige" tilfeller i Second Reader og Baseline-forhold. Fire forskjellige prevalensrater vil bli testet - 10 %, 33 %, 67 % og 90 %. Observatører vil fullføre 8 blokker (2 AI-regler x 4 prevalensrater), og blokkrekkefølgen er tilfeldig.
AI-regler som skal testes:
- Baseline - Ingen AI-inngang. Observer klassifiserer hvert tilfelle som "dårlig" eller "ikke" dårlig alene.
Andre leser - Observatøren tar en første avgjørelse om hver sak. AI klassifiserer stimuli stille ved å bruke et konservativt kriterium (c = 0,5). Logikken for det konservative kriteriet er at den andre leseren brukes til å kutte ned på falske positive svar, og det er derfor ment å stille spørsmål ved positive menneskelige svar som kan være marginale. Hvis observatøren og AI er uenige, informerer AI den menneskelige observatøren. Observatøren får deretter en sjanse til enten å endre svaret eller gå med sin første mening.
Som i forsøk 1-5 er AI d-prime fastsatt til 2.2. Tilbakemelding er kjent for å øke prevalenseffekten, så tilbakemelding vil bli gitt både i praksis og testforsøkene. Observatører vil gjennomføre 20 øvelsesforsøk og 200 testforsøk i hver blokk. Umiddelbart etter at hver blokk er fullført, vil observatører bli vist et sammendrag av deres prestasjoner. Etter Second Reader-blokkene vil de også bli bedt om å svare på tre subjektive spørsmål om nytten av AI (se "Filer" for flere detaljer).
Analyser. Spesifiser nøyaktig hvilke analyser du skal gjennomføre for å undersøke hovedspørsmålet/hypotesen.
Først oppsummerer vi antall treff, sanne negative, feil og falske alarmer i hver blokk. Fra dette kan vi beregne nøyaktigheten, den positive prediktive verdien, sensitiviteten (d-prime) og kriteriet for hver observatør under hver av de forskjellige forholdene. Gitt mål på ytelse ved 4 prevalensnivåer, kan vi estimere ROC-kurven (pHit x pFA) og zROC-funksjonen (zHit x zFA). Vi vil teste hypotesen om at helningen til zROC er lik 1 (konsekvensen av en lik varians 2AFC-oppgave).
Flere analyser. Noen sekundære analyser?
Vi vil se for å se om observatørenes subjektive meninger om AI er korrelert med variabler som den empiriske d-prime, eller den positive prediktive verdien.
Prøvestørrelse. Hvor mange observasjoner vil bli samlet inn, eller hva vil bestemme prøvestørrelsen? Du trenger ikke å begrunne avgjørelsen, men vær presis om nøyaktig hvordan antallet vil bli bestemt.
Vi skal teste 12 observatører. Dette samsvarer med prøvestørrelsene til tidligere eksperimenter.
- Annen. Er det noe annet du ønsker å forhåndsregistrere? (f.eks. dataekskluderinger, variabler samlet inn for utforskende formål, planlagte uvanlige analyser?)
N/A
Studietype
Registrering (Faktiske)
Fase
- Ikke aktuelt
Kontakter og plasseringer
Studiesteder
-
-
Massachusetts
-
Boston, Massachusetts, Forente stater, 02215
- Visual Attention Lab / Brigham and Women's Hospital
-
-
Deltakelseskriterier
Kvalifikasjonskriterier
Alder som er kvalifisert for studier
Tar imot friske frivillige
Beskrivelse
Inklusjonskriterier:
- - Alle er velkommen til å melde seg på online
Ekskluderingskriterier:
- Må bestå Ishihara fargesynsscreeningstest
- 20/25 syn (med korreksjon)
Studieplan
Hvordan er studiet utformet?
Designdetaljer
- Primært formål: Grunnvitenskap
- Tildeling: N/A
- Intervensjonsmodell: Enkeltgruppeoppdrag
- Masking: Ingen (Open Label)
Våpen og intervensjoner
Deltakergruppe / Arm |
Intervensjon / Behandling |
|---|---|
|
Eksperimentell: Eksperiment
Alle deltakerne blir testet under alle forhold i dette eksperimentet.
|
I dette eksperimentet, under noen forhold, tar deltakeren sin beslutning i nærvær av informasjon om en simulert avgjørelse om kunstig intelligens.
Hyppigheten som målene presenteres med varierer fra 10 % til 90 %
Andre navn:
|
Hva måler studien?
Primære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
D'
Tidsramme: Dataene samles inn i løpet av en økt på omtrent en time.
|
D' (d-prime) er signaldeteksjonsteoriens mål for prestasjonsnivå på en oppgave.
Den beregnes ved å regne ut andelen sanne positive responser =(sanne positive forsøk)/(sanne positive + falske negative forsøk) = p(TP) og ved å regne ut andelen falske positive responser =(falske positive forsøk)/(falske positive + sanne negative forsøk) = p(FP).
Disse verdiene transformeres til 'z-scorer' (for eksempel ved å bruke NORMSINV i Excel for å beregne inversen av standard normalfordeling).
D' er definert som Z(TP)-Z(FP).
Dens verdiområde er fra 0 for tilfeller hvor ingen signal kan skilles fra støyen, til ~4,0.
Øvre grense er ikke definert, men 4 ville bety at en observatør er i praksis perfekt til å skille signal fra støy.
|
Dataene samles inn i løpet av en økt på omtrent en time.
|
|
Kriterium
Tidsramme: Data samles inn i løpet av en time.
|
Kriteriet, som D' (se ovenfor), beregnes fra z(TP) og z(FP).
Kriteriet (c) = (z(TP)+z(FP))/-2.
En verdi på null betyr at observatøren er like sannsynlig til å gi et positivt (f.eks. 'mål til stede') svar som et negativt (fra værende) svar.
Positive verdier betyr at observatøren er mer tilbøyelig til å si "fra værende" (et "konservativt" kriterium).
Negative verdier betyr at observatøren er mer tilbøyelig til å si "til stede" (et "liberalt" kriterium).
Liberalt og konservativt har ingen politiske konnotasjoner i dette tilfellet.
Kriterieverdier faller nesten alltid mellom -2 og 2.
|
Data samles inn i løpet av en time.
|
Sekundære resultatmål
Resultatmål |
Tiltaksbeskrivelse |
Tidsramme |
|---|---|---|
|
Reaksjonstid
Tidsramme: Dataene samles inn i løpet av en time.
|
Dette er et mål på hvor lang tid det tar å gi et svar.
|
Dataene samles inn i løpet av en time.
|
Samarbeidspartnere og etterforskere
Sponsor
Samarbeidspartnere
Etterforskere
- Hovedetterforsker: Jeremy M Wolfe, PhD, Brigham and Women's Hospital
Studierekorddatoer
Studer hoveddatoer
Studiestart (Faktiske)
Primær fullføring (Faktiske)
Studiet fullført (Faktiske)
Datoer for studieregistrering
Først innsendt
Først innsendt som oppfylte QC-kriteriene
Først lagt ut (Faktiske)
Oppdateringer av studieposter
Sist oppdatering lagt ut (Faktiske)
Siste oppdatering sendt inn som oppfylte QC-kriteriene
Sist bekreftet
Mer informasjon
Begreper knyttet til denne studien
Nøkkelord
Ytterligere relevante MeSH-vilkår
Andre studie-ID-numre
- 2007P000646-B
- R01CA207490 (U.S. NIH-stipend/kontrakt)
Plan for individuelle deltakerdata (IPD)
Planlegger du å dele individuelle deltakerdata (IPD)?
IPD-planbeskrivelse
IPD-delingstidsramme
Tilgangskriterier for IPD-deling
IPD-deling Støtteinformasjonstype
- STUDY_PROTOCOL
- SEVJE
- ICF
Legemiddel- og utstyrsinformasjon, studiedokumenter
Studerer et amerikansk FDA-regulert medikamentprodukt
Studerer et amerikansk FDA-regulert enhetsprodukt
Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .