Denne siden ble automatisk oversatt og nøyaktigheten av oversettelsen er ikke garantert. Vennligst referer til engelsk versjon for en kildetekst.

Prosjekt 3 Eksempel: Human-AI Collaboration Tester (HAICT) Exp. 7

29. desember 2025 oppdatert av: Jeremy M Wolfe, PhD, Brigham and Women's Hospital
Studien er en del av en "bunt" av eksperimenter som utgjør prosjekt tre av en National Eye Institute-bevilgning. Prosjekt tre inkluderer en serie eksperimenter som undersøker hvordan endring av input fra en simulert AI kan påvirke avgjørelsene tatt av menneskelige observatører i en to-alternativ tvangsvalgoppgave (som beslutningen om å tilbakekalle en kvinne for videre undersøkelse i mammografi). HAICT 7, eksperimentet beskrevet her, undersøker hvordan endret prevalens påvirker menneskelig ytelse når AI brukes som en andre leser.

Studieoversikt

Detaljert beskrivelse

Denne teksten er teksten til forhåndsregistreringen for HAICT 7-eksperimentet som beskrevet på Open Science Framework. https://osf.io/hngu4/

MERK: Denne studien er representativ for studier utført i prosjekt 3 av denne bevilgningen. Det er flere eksperimenter i bunten av eksperimenter representert av prosjekt 3, men det er ikke mulig å registrere en bunt med studier på CT.gov.

MERK: Siden pronomenkommentaren er rådgivende, lar vi den stå for nå.

Human-AI Collaboration Tester (HAICT) Exp. 7 (lett redigert fra OSF)

  1. Datainnsamling. Er det allerede samlet inn noen data for denne studien? (Ja Nei)

    ja

  2. Hypotese. Hva er hovedspørsmålet eller hypotesen som testes i denne studien?

Bakgrunn: I en rekke søkeeksperimenter, både grunnleggende og kliniske, har dataene vært konsistente med en situasjon der variasjonen til signalet (eller målet) er større enn variasjonen til støyen (distraksjoner). Det klassiske tegnet på dette er en zROC-funksjon med en helning < 1 - typisk rundt 0,6. En helning på 1,0 er en indikasjon på en 2AFC-oppgave med lik varians. For HAICT-oppgaven som vi har testet, ville vi forvente lik varians, men vi tror det vil være verdt å sjekke, så vi vil systematisk variere prevalensen som vil skifte kriterium. Det vil feie ut en ROC-kurve som vi kan undersøke.

Vi vil også teste Second Reader faux-AI for å finne ut om lav prevalens gjør Second Reader verre.

  • (H1): Vi forventer å gjenskape funnet om at menneskelige kriterier blir mer konservative ettersom prevalensen avtar.
  • (H2): Vi spår at helningen til den resulterende zROC vil være 1,0.
  • (H3): Vi antar at lav prevalens vil gjøre Second Reader AI mindre effektiv fordi den positive prediktive verdien av kommentarene vil være lav.

    1. Avhengig variabel. Beskriv nøkkelavhengige variabler og spesifisere hvordan de vil bli målt.

      De viktigste avhengige variablene av interesse er nøyaktighet (og signaldeteksjonsderivatene av nøyaktighet, d' og c), reaksjonstid og subjektive vurderinger på undersøkelsen etter hver blokk.

    2. Forhold. Hvor mange og hvilke betingelser vil deltakerne bli tildelt?

Denne serien med eksperimenter undersøker hvordan endring av input fra en simulert AI kan påvirke avgjørelsene tatt av menneskelige observatører i en to-alternativ tvangsvalgoppgave (som beslutningen om å tilbakekalle en kvinne for videre undersøkelse i mammografi). Vi har utviklet et paradigme kalt Human-AI Collaboration Tester (HAICT) som muliggjør effektiv testing av interaksjoner mellom et menneske og en simulert AI.

Observatørenes oppgave under alle forhold er å gi en 2AFC-avgjørelse om hvorvidt en stimulus er "dårlig" eller "ikke dårlig." For å bruke språk som grovt etterligner en medisinsk diagnose, blir hver stimulus referert til som et "tilfelle". Observatører blir bedt om å ta en 2AFC-beslutning om matriser av fargede former. Avgjørelsen treffes ut fra sakens dominerende farge. Antall elementer i hver farge er trukket fra en av to normalfordelinger, en for positive (dårlige) stimuli og den andre for negative (ikke dårlige) stimuli.

Resultatene fra tidligere HAICT-eksperimenter (3 og 4) viste at menneskelig ytelse i Second Reader-tilstanden avtar betydelig ved lav prevalens. Ytelsen i Second Reader-tilstanden var bedre enn baseline når prevalensen av dårlige tilfeller var 50 %, men var signifikant dårligere enn baseline når prevalensen bare var 10 %. I dette eksperimentet manipulerer vi utbredelsen av "dårlige" tilfeller i Second Reader og Baseline-forhold. Fire forskjellige prevalensrater vil bli testet - 10 %, 33 %, 67 % og 90 %. Observatører vil fullføre 8 blokker (2 AI-regler x 4 prevalensrater), og blokkrekkefølgen er tilfeldig.

AI-regler som skal testes:

  1. Baseline - Ingen AI-inngang. Observer klassifiserer hvert tilfelle som "dårlig" eller "ikke" dårlig alene.
  2. Andre leser - Observatøren tar en første avgjørelse om hver sak. AI klassifiserer stimuli stille ved å bruke et konservativt kriterium (c = 0,5). Logikken for det konservative kriteriet er at den andre leseren brukes til å kutte ned på falske positive svar, og det er derfor ment å stille spørsmål ved positive menneskelige svar som kan være marginale. Hvis observatøren og AI er uenige, informerer AI den menneskelige observatøren. Observatøren får deretter en sjanse til enten å endre svaret eller gå med sin første mening.

    Som i forsøk 1-5 er AI d-prime fastsatt til 2.2. Tilbakemelding er kjent for å øke prevalenseffekten, så tilbakemelding vil bli gitt både i praksis og testforsøkene. Observatører vil gjennomføre 20 øvelsesforsøk og 200 testforsøk i hver blokk. Umiddelbart etter at hver blokk er fullført, vil observatører bli vist et sammendrag av deres prestasjoner. Etter Second Reader-blokkene vil de også bli bedt om å svare på tre subjektive spørsmål om nytten av AI (se "Filer" for flere detaljer).

  3. Analyser. Spesifiser nøyaktig hvilke analyser du skal gjennomføre for å undersøke hovedspørsmålet/hypotesen.

    Først oppsummerer vi antall treff, sanne negative, feil og falske alarmer i hver blokk. Fra dette kan vi beregne nøyaktigheten, den positive prediktive verdien, sensitiviteten (d-prime) og kriteriet for hver observatør under hver av de forskjellige forholdene. Gitt mål på ytelse ved 4 prevalensnivåer, kan vi estimere ROC-kurven (pHit x pFA) og zROC-funksjonen (zHit x zFA). Vi vil teste hypotesen om at helningen til zROC er lik 1 (konsekvensen av en lik varians 2AFC-oppgave).

  4. Flere analyser. Noen sekundære analyser?

    Vi vil se for å se om observatørenes subjektive meninger om AI er korrelert med variabler som den empiriske d-prime, eller den positive prediktive verdien.

  5. Prøvestørrelse. Hvor mange observasjoner vil bli samlet inn, eller hva vil bestemme prøvestørrelsen? Du trenger ikke å begrunne avgjørelsen, men vær presis om nøyaktig hvordan antallet vil bli bestemt.

    Vi skal teste 12 observatører. Dette samsvarer med prøvestørrelsene til tidligere eksperimenter.

  6. Annen. Er det noe annet du ønsker å forhåndsregistrere? (f.eks. dataekskluderinger, variabler samlet inn for utforskende formål, planlagte uvanlige analyser?)

N/A

Studietype

Intervensjonell

Registrering (Faktiske)

12

Fase

  • Ikke aktuelt

Kontakter og plasseringer

Denne delen inneholder kontaktinformasjon for de som utfører studien, og informasjon om hvor denne studien blir utført.

Studiesteder

    • Massachusetts
      • Boston, Massachusetts, Forente stater, 02215
        • Visual Attention Lab / Brigham and Women's Hospital

Deltakelseskriterier

Forskere ser etter personer som passer til en bestemt beskrivelse, kalt kvalifikasjonskriterier. Noen eksempler på disse kriteriene er en persons generelle helsetilstand eller tidligere behandlinger.

Kvalifikasjonskriterier

Alder som er kvalifisert for studier

18 år og eldre (Voksen, Eldre voksen)

Tar imot friske frivillige

Ja

Beskrivelse

Inklusjonskriterier:

  • - Alle er velkommen til å melde seg på online

Ekskluderingskriterier:

  • Må bestå Ishihara fargesynsscreeningstest
  • 20/25 syn (med korreksjon)

Studieplan

Denne delen gir detaljer om studieplanen, inkludert hvordan studien er utformet og hva studien måler.

Hvordan er studiet utformet?

Designdetaljer

  • Primært formål: Grunnvitenskap
  • Tildeling: N/A
  • Intervensjonsmodell: Enkeltgruppeoppdrag
  • Masking: Ingen (Open Label)

Våpen og intervensjoner

Deltakergruppe / Arm
Intervensjon / Behandling
Eksperimentell: Eksperiment
Alle deltakerne blir testet under alle forhold i dette eksperimentet.
I dette eksperimentet, under noen forhold, tar deltakeren sin beslutning i nærvær av informasjon om en simulert avgjørelse om kunstig intelligens.
Hyppigheten som målene presenteres med varierer fra 10 % til 90 %
Andre navn:
  • Grunnsats

Hva måler studien?

Primære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
D'
Tidsramme: Dataene samles inn i løpet av en økt på omtrent en time.
D' (d-prime) er signaldeteksjonsteoriens mål for prestasjonsnivå på en oppgave. Den beregnes ved å regne ut andelen sanne positive responser =(sanne positive forsøk)/(sanne positive + falske negative forsøk) = p(TP) og ved å regne ut andelen falske positive responser =(falske positive forsøk)/(falske positive + sanne negative forsøk) = p(FP). Disse verdiene transformeres til 'z-scorer' (for eksempel ved å bruke NORMSINV i Excel for å beregne inversen av standard normalfordeling). D' er definert som Z(TP)-Z(FP). Dens verdiområde er fra 0 for tilfeller hvor ingen signal kan skilles fra støyen, til ~4,0. Øvre grense er ikke definert, men 4 ville bety at en observatør er i praksis perfekt til å skille signal fra støy.
Dataene samles inn i løpet av en økt på omtrent en time.
Kriterium
Tidsramme: Data samles inn i løpet av en time.
Kriteriet, som D' (se ovenfor), beregnes fra z(TP) og z(FP). Kriteriet (c) = (z(TP)+z(FP))/-2. En verdi på null betyr at observatøren er like sannsynlig til å gi et positivt (f.eks. 'mål til stede') svar som et negativt (fra værende) svar. Positive verdier betyr at observatøren er mer tilbøyelig til å si "fra værende" (et "konservativt" kriterium). Negative verdier betyr at observatøren er mer tilbøyelig til å si "til stede" (et "liberalt" kriterium). Liberalt og konservativt har ingen politiske konnotasjoner i dette tilfellet. Kriterieverdier faller nesten alltid mellom -2 og 2.
Data samles inn i løpet av en time.

Sekundære resultatmål

Resultatmål
Tiltaksbeskrivelse
Tidsramme
Reaksjonstid
Tidsramme: Dataene samles inn i løpet av en time.
Dette er et mål på hvor lang tid det tar å gi et svar.
Dataene samles inn i løpet av en time.

Samarbeidspartnere og etterforskere

Det er her du vil finne personer og organisasjoner som er involvert i denne studien.

Samarbeidspartnere

Etterforskere

  • Hovedetterforsker: Jeremy M Wolfe, PhD, Brigham and Women's Hospital

Studierekorddatoer

Disse datoene sporer fremdriften for innsending av studieposter og sammendragsresultater til ClinicalTrials.gov. Studieposter og rapporterte resultater gjennomgås av National Library of Medicine (NLM) for å sikre at de oppfyller spesifikke kvalitetskontrollstandarder før de legges ut på det offentlige nettstedet.

Studer hoveddatoer

Studiestart (Faktiske)

1. januar 2020

Primær fullføring (Faktiske)

1. august 2024

Studiet fullført (Faktiske)

4. november 2025

Datoer for studieregistrering

Først innsendt

18. februar 2022

Først innsendt som oppfylte QC-kriteriene

28. februar 2022

Først lagt ut (Faktiske)

9. mars 2022

Oppdateringer av studieposter

Sist oppdatering lagt ut (Faktiske)

20. januar 2026

Siste oppdatering sendt inn som oppfylte QC-kriteriene

29. desember 2025

Sist bekreftet

1. desember 2025

Mer informasjon

Begreper knyttet til denne studien

Ytterligere relevante MeSH-vilkår

Andre studie-ID-numre

  • 2007P000646-B
  • R01CA207490 (U.S. NIH-stipend/kontrakt)

Plan for individuelle deltakerdata (IPD)

Planlegger du å dele individuelle deltakerdata (IPD)?

JA

IPD-planbeskrivelse

Avidentifiserte rådata vil bli lagt ut på eksperimentets OSF-side og vil også være tilgjengelig på forespørsel til PI.

IPD-delingstidsramme

Materialer vil være tilgjengelig når det er forespørsel

Tilgangskriterier for IPD-deling

i hovedsak ubegrenset

IPD-deling Støtteinformasjonstype

  • STUDY_PROTOCOL
  • SEVJE
  • ICF

Legemiddel- og utstyrsinformasjon, studiedokumenter

Studerer et amerikansk FDA-regulert medikamentprodukt

Nei

Studerer et amerikansk FDA-regulert enhetsprodukt

Nei

Denne informasjonen ble hentet direkte fra nettstedet clinicaltrials.gov uten noen endringer. Hvis du har noen forespørsler om å endre, fjerne eller oppdatere studiedetaljene dine, vennligst kontakt register@clinicaltrials.gov. Så snart en endring er implementert på clinicaltrials.gov, vil denne også bli oppdatert automatisk på nettstedet vårt. .

Abonnere