- ICH GCP
- Amerikanska kliniska prövningsregistret
- Klinisk prövning NCT05272189
Projekt 3 Exempel: Human-AI Collaboration Tester (HAICT) Exp. 7
Studieöversikt
Status
Betingelser
Intervention / Behandling
Detaljerad beskrivning
Denna text är texten till förhandsregistreringen för HAICT 7-experimentet som beskrivs i Open Science Framework. https://osf.io/hngu4/
OBS: Denna studie är representativ för studier som genomförts i projekt 3 av detta anslag. Det finns flera experiment i experimentpaketet som representeras av Projekt 3 men det är inte möjligt att registrera ett knippe studier på CT.gov.
OBS: Eftersom pronomenkommentaren är rådgivande lämnar vi den tills vidare.
Human-AI Collaboration Tester (HAICT) Exp. 7 (lätt redigerad från OSF)
Datainsamling. Har någon data redan samlats in för denna studie? (Ja Nej)
ja
- Hypotes. Vilken är huvudfrågan som ställs eller hypotesen som testas i denna studie?
Bakgrund: I en mängd olika sökexperiment, både grundläggande och kliniska, har data varit förenliga med en situation där variabiliteten hos signalen (eller målet) är större än variabiliteten hos bruset (distraherare). Det klassiska tecknet på detta är en zROC-funktion med en lutning < 1 - vanligtvis runt 0,6. En lutning på 1,0 indikerar en 2AFC-uppgift med lika varians. För HAICT-uppgiften som vi har testat skulle vi förvänta oss lika varians, men vi tycker att det skulle vara värt att kontrollera så vi kommer systematiskt att variera prevalensen vilket kommer att ändra kriteriet. Det kommer att sopa ut en ROC-kurva som vi kan undersöka.
Vi kommer också att testa Second Reader faux-AI för att avgöra om låg prevalens gör Second Reader värre.
- (H1): Vi förväntar oss att replikera upptäckten att mänskliga kriterier blir mer konservativa när prevalensen minskar.
- (H2): Vi förutspår att lutningen för den resulterande zROC kommer att vara 1,0.
(H3): Vi antar att låg prevalens kommer att göra Second Reader AI mindre effektiv eftersom det positiva prediktiva värdet av dess kommentarer kommer att vara lågt.
Beroende variabel. Beskriv nyckelberoende variabel(er) och specificera hur de kommer att mätas.
De huvudsakliga beroende variablerna av intresse är noggrannhet (och signaldetekteringsderivator av noggrannhet, d' och c), reaktionstid och subjektiva betyg på undersökningen efter varje block.
- Betingelser. Hur många och vilka villkor kommer deltagarna att tilldelas?
Denna serie experiment undersöker hur en förändring av input från en simulerad AI kan påverka de beslut som fattas av mänskliga observatörer i en två-alternativ tvångsvalsuppgift (som beslutet att återkalla en kvinna för vidare undersökning i mammografi). Vi har utvecklat ett paradigm som kallas Human-AI Collaboration Tester (HAICT) som möjliggör effektiv testning av interaktioner mellan en människa och en simulerad AI.
Observatörernas uppgift under alla förhållanden är att ge ett 2AFC-beslut om huruvida en stimulans är "dålig" eller "inte dålig". För att använda ett språk som ungefär efterliknar en medicinsk diagnos, kallas varje stimulans som ett "fall". Observatörer uppmanas att fatta ett 2AFC-beslut om arrayer av färgade former. Beslutet fattas utifrån ärendets övervägande färg. Antalet element i varje färg hämtas från en av två normalfördelningar, en för positiva (dåliga) stimuli och den andra för negativa (inte dåliga) stimuli.
Resultaten från tidigare HAICT-experiment (3 och 4) visade att mänsklig prestation i Second Reader-tillståndet sjunker signifikant vid låg prevalens. Prevalensen i Second Reader-tillståndet var bättre än Baseline när prevalensen av dåliga fall var 50 % men var signifikant sämre än Baseline när prevalensen endast var 10 %. I det här experimentet manipulerar vi förekomsten av "dåliga" fall i Second Reader och Baseline-förhållanden. Fyra olika prevalensfrekvenser kommer att testas - 10 %, 33 %, 67 % och 90 %. Observatörer kommer att slutföra 8 block (2 AI-regler x 4 prevalensfrekvenser), och blockordningen är slumpmässig.
AI-regler som ska testas:
- Baslinje - Ingen AI-ingång. Observer klassificerar varje fall som "dåligt" eller "inte" dåligt på egen hand.
Andra läsaren - Observatören fattar ett första beslut om varje fall. AI:n klassificerar tyst stimuli med hjälp av ett konservativt kriterium (c = 0,5). Logiken för det konservativa kriteriet är att den andra läsaren används för att minska antalet falska positiva svar och därför är det tänkt att ifrågasätta positiva mänskliga svar som kan vara marginella. Om observatören och AI inte är överens, informerar AI den mänskliga observatören. Observatören får sedan en chans att antingen ändra sitt svar eller gå med sin första åsikt.
Som i experiment 1-5 är AI d-prime fixerad till 2,2. Feedback är känt för att öka prevalenseffekten, så feedback kommer att ges i både praktiken och testförsöken. Observatörer kommer att genomföra 20 övningsförsök och 200 testförsök i varje block. Omedelbart efter att varje block är klart kommer observatörerna att få en sammanfattning av deras prestationer. Efter Second Reader-blocken kommer de också att bli ombedda att svara på tre subjektiva frågor om användbarheten av AI (se "Filer" för mer information).
Analyser. Specificera exakt vilka analyser du ska göra för att granska huvudfrågan/hypotesen.
Först sammanfattar vi antalet träffar, sanna negativ, missar och falska larm i varje block. Utifrån detta kan vi beräkna noggrannheten, det positiva prediktiva värdet, känsligheten (d-prime) och kriteriet för varje observatör under vart och ett av de olika förhållandena. Givet mått på prestanda vid 4 prevalensnivåer kan vi uppskatta ROC-kurvan (pHit x pFA) och zROC-funktionen (zHit x zFA). Vi kommer att testa hypotesen att lutningen för zROC är lika med 1 (konsekvensen av en lika varians 2AFC-uppgift).
Fler analyser. Några sekundära analyser?
Vi kommer att se om observatörernas subjektiva åsikter om AI är korrelerade med variabler som det empiriska d-prime eller det positiva prediktiva värdet.
Provstorlek. Hur många observationer kommer att samlas in eller vad kommer att avgöra urvalets storlek? Inget behov av att motivera beslut, men var exakt om exakt hur antalet kommer att fastställas.
Vi kommer att testa 12 observatörer. Detta överensstämmer med provstorlekarna från tidigare experiment.
- Övrig. Finns det något mer du vill föranmäla? (t.ex. datauteslutningar, variabler som samlats in för utforskande syften, planerade ovanliga analyser?)
N/A
Studietyp
Inskrivning (Faktisk)
Fas
- Inte tillämpbar
Kontakter och platser
Studieorter
-
-
Massachusetts
-
Boston, Massachusetts, Förenta staterna, 02215
- Visual Attention Lab / Brigham and Women's Hospital
-
-
Deltagandekriterier
Urvalskriterier
Åldrar som är berättigade till studier
Tar emot friska volontärer
Beskrivning
Inklusionskriterier:
- - Alla är välkomna att anmäla sig online
Exklusions kriterier:
- Måste klara Ishiharas färgsynstest
- 20/25 vision (med korrigering)
Studieplan
Hur är studien utformad?
Designdetaljer
- Primärt syfte: Grundläggande vetenskap
- Tilldelning: N/A
- Interventionsmodell: Enskild gruppuppgift
- Maskning: Ingen (Open Label)
Vapen och interventioner
Deltagargrupp / Arm |
Intervention / Behandling |
|---|---|
|
Experimentell: Experimentera
Alla deltagare testas under alla förhållanden i detta experiment.
|
I detta experiment, under vissa förhållanden, fattar deltagaren sitt beslut i närvaro av information om ett simulerat beslut om artificiell intelligens.
Frekvensen med vilka mål presenteras varierar från 10 % till 90 %
Andra namn:
|
Vad mäter studien?
Primära resultatmått
Resultatmått |
Åtgärdsbeskrivning |
Tidsram |
|---|---|---|
|
D'
Tidsram: Data samlas in inom en session på ungefär en timme.
|
D' (d-prime) är signaldetektionsteorins mått på prestationsnivån i en uppgift.
Det beräknas genom att beräkna andelen sanna positiva svar = (sanna positiva försök)/(sanna positiva + falska negativa försök) = p(TP) och genom att beräkna andelen falska positiva svar = (falska positiva försök)/(falska positiva + sanna negativa försök) = p(FP).
Dessa värden omvandlas till 'z-poäng' (till exempel genom att använda NORMSINV i Excel för att beräkna inversen av standardnormalfördelningen).
D' definieras som Z(TP)-Z(FP).
Dess intervall sträcker sig från 0 för fall där ingen signal kan särskiljas från bruset, till ~4,0.
Den övre gränsen är inte definierad, men 4 skulle innebära att en observatör i princip är perfekt på att särskilja signal från brus.
|
Data samlas in inom en session på ungefär en timme.
|
|
Kriterium
Tidsram: Data samlas in under ett pass på cirka en timme.
|
Kriteriet, liksom D' (se ovan), beräknas från z(TP) och z(FP).
Kriterium ( c ) = (z(TP)+z(FP))/-2.
Ett värde på noll innebär att observatören är lika benägen att ge ett positivt (t.ex.
'mål närvarande') svar som ett negativt (frånvarande) svar.
Positiva värden innebär att observatören är mer benägen att säga "frånvarande" (ett "konservativt" kriterium).
Negativa värden innebär att observatören är mer benägen att säga "närvarande" (ett "liberalt" kriterium).
Liberala och konservativa har i detta fall inga politiska konnotationer.
Kriterievärden ligger nästan alltid mellan -2 och 2.
|
Data samlas in under ett pass på cirka en timme.
|
Sekundära resultatmått
Resultatmått |
Åtgärdsbeskrivning |
Tidsram |
|---|---|---|
|
Reaktionstid
Tidsram: Data samlas in under en session på cirka en timme.
|
Detta är ett mått på hur lång tid det tar att göra ett svar.
|
Data samlas in under en session på cirka en timme.
|
Samarbetspartners och utredare
Sponsor
Samarbetspartners
Utredare
- Huvudutredare: Jeremy M Wolfe, PhD, Brigham and Women's Hospital
Studieavstämningsdatum
Studera stora datum
Studiestart (Faktisk)
Primärt slutförande (Faktisk)
Avslutad studie (Faktisk)
Studieregistreringsdatum
Först inskickad
Först inskickad som uppfyllde QC-kriterierna
Första postat (Faktisk)
Uppdateringar av studier
Senaste uppdatering publicerad (Faktisk)
Senaste inskickade uppdateringen som uppfyllde QC-kriterierna
Senast verifierad
Mer information
Termer relaterade till denna studie
Nyckelord
Ytterligare relevanta MeSH-villkor
Andra studie-ID-nummer
- 2007P000646-B
- R01CA207490 (U.S.S. NIH-anslag/kontrakt)
Plan för individuella deltagardata (IPD)
Planerar du att dela individuella deltagardata (IPD)?
IPD-planbeskrivning
Tidsram för IPD-delning
Kriterier för IPD Sharing Access
IPD-delning som stöder informationstyp
- STUDY_PROTOCOL
- SAV
- ICF
Läkemedels- och apparatinformation, studiedokument
Studerar en amerikansk FDA-reglerad läkemedelsprodukt
Studerar en amerikansk FDA-reglerad produktprodukt
Denna information hämtades direkt från webbplatsen clinicaltrials.gov utan några ändringar. Om du har några önskemål om att ändra, ta bort eller uppdatera dina studieuppgifter, vänligen kontakta register@clinicaltrials.gov. Så snart en ändring har implementerats på clinicaltrials.gov, kommer denna att uppdateras automatiskt även på vår webbplats .