Denna sida har översatts automatiskt och översättningens korrekthet kan inte garanteras. Vänligen se engelsk version för en källtext.

Projekt 3 Exempel: Human-AI Collaboration Tester (HAICT) Exp. 7

29 december 2025 uppdaterad av: Jeremy M Wolfe, PhD, Brigham and Women's Hospital
Studien är en del av ett "paket" av experiment som utgör projekt tre i ett anslag från National Eye Institute. Projekt tre innehåller en serie experiment som undersöker hur en förändring av input från en simulerad AI kan påverka de beslut som fattas av mänskliga observatörer i en tvåalternativt tvångsvalsuppgift (som beslutet att återkalla en kvinna för vidare undersökning i mammografi). HAICT 7, experimentet som beskrivs här, undersöker hur förändrad prevalens påverkar mänsklig prestation när AI används som en andra läsare.

Studieöversikt

Detaljerad beskrivning

Denna text är texten till förhandsregistreringen för HAICT 7-experimentet som beskrivs i Open Science Framework. https://osf.io/hngu4/

OBS: Denna studie är representativ för studier som genomförts i projekt 3 av detta anslag. Det finns flera experiment i experimentpaketet som representeras av Projekt 3 men det är inte möjligt att registrera ett knippe studier på CT.gov.

OBS: Eftersom pronomenkommentaren är rådgivande lämnar vi den tills vidare.

Human-AI Collaboration Tester (HAICT) Exp. 7 (lätt redigerad från OSF)

  1. Datainsamling. Har någon data redan samlats in för denna studie? (Ja Nej)

    ja

  2. Hypotes. Vilken är huvudfrågan som ställs eller hypotesen som testas i denna studie?

Bakgrund: I en mängd olika sökexperiment, både grundläggande och kliniska, har data varit förenliga med en situation där variabiliteten hos signalen (eller målet) är större än variabiliteten hos bruset (distraherare). Det klassiska tecknet på detta är en zROC-funktion med en lutning < 1 - vanligtvis runt 0,6. En lutning på 1,0 indikerar en 2AFC-uppgift med lika varians. För HAICT-uppgiften som vi har testat skulle vi förvänta oss lika varians, men vi tycker att det skulle vara värt att kontrollera så vi kommer systematiskt att variera prevalensen vilket kommer att ändra kriteriet. Det kommer att sopa ut en ROC-kurva som vi kan undersöka.

Vi kommer också att testa Second Reader faux-AI för att avgöra om låg prevalens gör Second Reader värre.

  • (H1): Vi förväntar oss att replikera upptäckten att mänskliga kriterier blir mer konservativa när prevalensen minskar.
  • (H2): Vi förutspår att lutningen för den resulterande zROC kommer att vara 1,0.
  • (H3): Vi antar att låg prevalens kommer att göra Second Reader AI mindre effektiv eftersom det positiva prediktiva värdet av dess kommentarer kommer att vara lågt.

    1. Beroende variabel. Beskriv nyckelberoende variabel(er) och specificera hur de kommer att mätas.

      De huvudsakliga beroende variablerna av intresse är noggrannhet (och signaldetekteringsderivator av noggrannhet, d' och c), reaktionstid och subjektiva betyg på undersökningen efter varje block.

    2. Betingelser. Hur många och vilka villkor kommer deltagarna att tilldelas?

Denna serie experiment undersöker hur en förändring av input från en simulerad AI kan påverka de beslut som fattas av mänskliga observatörer i en två-alternativ tvångsvalsuppgift (som beslutet att återkalla en kvinna för vidare undersökning i mammografi). Vi har utvecklat ett paradigm som kallas Human-AI Collaboration Tester (HAICT) som möjliggör effektiv testning av interaktioner mellan en människa och en simulerad AI.

Observatörernas uppgift under alla förhållanden är att ge ett 2AFC-beslut om huruvida en stimulans är "dålig" eller "inte dålig". För att använda ett språk som ungefär efterliknar en medicinsk diagnos, kallas varje stimulans som ett "fall". Observatörer uppmanas att fatta ett 2AFC-beslut om arrayer av färgade former. Beslutet fattas utifrån ärendets övervägande färg. Antalet element i varje färg hämtas från en av två normalfördelningar, en för positiva (dåliga) stimuli och den andra för negativa (inte dåliga) stimuli.

Resultaten från tidigare HAICT-experiment (3 och 4) visade att mänsklig prestation i Second Reader-tillståndet sjunker signifikant vid låg prevalens. Prevalensen i Second Reader-tillståndet var bättre än Baseline när prevalensen av dåliga fall var 50 % men var signifikant sämre än Baseline när prevalensen endast var 10 %. I det här experimentet manipulerar vi förekomsten av "dåliga" fall i Second Reader och Baseline-förhållanden. Fyra olika prevalensfrekvenser kommer att testas - 10 %, 33 %, 67 % och 90 %. Observatörer kommer att slutföra 8 block (2 AI-regler x 4 prevalensfrekvenser), och blockordningen är slumpmässig.

AI-regler som ska testas:

  1. Baslinje - Ingen AI-ingång. Observer klassificerar varje fall som "dåligt" eller "inte" dåligt på egen hand.
  2. Andra läsaren - Observatören fattar ett första beslut om varje fall. AI:n klassificerar tyst stimuli med hjälp av ett konservativt kriterium (c = 0,5). Logiken för det konservativa kriteriet är att den andra läsaren används för att minska antalet falska positiva svar och därför är det tänkt att ifrågasätta positiva mänskliga svar som kan vara marginella. Om observatören och AI inte är överens, informerar AI den mänskliga observatören. Observatören får sedan en chans att antingen ändra sitt svar eller gå med sin första åsikt.

    Som i experiment 1-5 är AI d-prime fixerad till 2,2. Feedback är känt för att öka prevalenseffekten, så feedback kommer att ges i både praktiken och testförsöken. Observatörer kommer att genomföra 20 övningsförsök och 200 testförsök i varje block. Omedelbart efter att varje block är klart kommer observatörerna att få en sammanfattning av deras prestationer. Efter Second Reader-blocken kommer de också att bli ombedda att svara på tre subjektiva frågor om användbarheten av AI (se "Filer" för mer information).

  3. Analyser. Specificera exakt vilka analyser du ska göra för att granska huvudfrågan/hypotesen.

    Först sammanfattar vi antalet träffar, sanna negativ, missar och falska larm i varje block. Utifrån detta kan vi beräkna noggrannheten, det positiva prediktiva värdet, känsligheten (d-prime) och kriteriet för varje observatör under vart och ett av de olika förhållandena. Givet mått på prestanda vid 4 prevalensnivåer kan vi uppskatta ROC-kurvan (pHit x pFA) och zROC-funktionen (zHit x zFA). Vi kommer att testa hypotesen att lutningen för zROC är lika med 1 (konsekvensen av en lika varians 2AFC-uppgift).

  4. Fler analyser. Några sekundära analyser?

    Vi kommer att se om observatörernas subjektiva åsikter om AI är korrelerade med variabler som det empiriska d-prime eller det positiva prediktiva värdet.

  5. Provstorlek. Hur många observationer kommer att samlas in eller vad kommer att avgöra urvalets storlek? Inget behov av att motivera beslut, men var exakt om exakt hur antalet kommer att fastställas.

    Vi kommer att testa 12 observatörer. Detta överensstämmer med provstorlekarna från tidigare experiment.

  6. Övrig. Finns det något mer du vill föranmäla? (t.ex. datauteslutningar, variabler som samlats in för utforskande syften, planerade ovanliga analyser?)

N/A

Studietyp

Interventionell

Inskrivning (Faktisk)

12

Fas

  • Inte tillämpbar

Kontakter och platser

Det här avsnittet innehåller kontaktuppgifter för dem som genomför studien och information om var denna studie genomförs.

Studieorter

    • Massachusetts
      • Boston, Massachusetts, Förenta staterna, 02215
        • Visual Attention Lab / Brigham and Women's Hospital

Deltagandekriterier

Forskare letar efter personer som passar en viss beskrivning, så kallade behörighetskriterier. Några exempel på dessa kriterier är en persons allmänna hälsotillstånd eller tidigare behandlingar.

Urvalskriterier

Åldrar som är berättigade till studier

18 år och äldre (Vuxen, Äldre vuxen)

Tar emot friska volontärer

Ja

Beskrivning

Inklusionskriterier:

  • - Alla är välkomna att anmäla sig online

Exklusions kriterier:

  • Måste klara Ishiharas färgsynstest
  • 20/25 vision (med korrigering)

Studieplan

Det här avsnittet ger detaljer om studieplanen, inklusive hur studien är utformad och vad studien mäter.

Hur är studien utformad?

Designdetaljer

  • Primärt syfte: Grundläggande vetenskap
  • Tilldelning: N/A
  • Interventionsmodell: Enskild gruppuppgift
  • Maskning: Ingen (Open Label)

Vapen och interventioner

Deltagargrupp / Arm
Intervention / Behandling
Experimentell: Experimentera
Alla deltagare testas under alla förhållanden i detta experiment.
I detta experiment, under vissa förhållanden, fattar deltagaren sitt beslut i närvaro av information om ett simulerat beslut om artificiell intelligens.
Frekvensen med vilka mål presenteras varierar från 10 % till 90 %
Andra namn:
  • Baspris

Vad mäter studien?

Primära resultatmått

Resultatmått
Åtgärdsbeskrivning
Tidsram
D'
Tidsram: Data samlas in inom en session på ungefär en timme.
D' (d-prime) är signaldetektionsteorins mått på prestationsnivån i en uppgift. Det beräknas genom att beräkna andelen sanna positiva svar = (sanna positiva försök)/(sanna positiva + falska negativa försök) = p(TP) och genom att beräkna andelen falska positiva svar = (falska positiva försök)/(falska positiva + sanna negativa försök) = p(FP). Dessa värden omvandlas till 'z-poäng' (till exempel genom att använda NORMSINV i Excel för att beräkna inversen av standardnormalfördelningen). D' definieras som Z(TP)-Z(FP). Dess intervall sträcker sig från 0 för fall där ingen signal kan särskiljas från bruset, till ~4,0. Den övre gränsen är inte definierad, men 4 skulle innebära att en observatör i princip är perfekt på att särskilja signal från brus.
Data samlas in inom en session på ungefär en timme.
Kriterium
Tidsram: Data samlas in under ett pass på cirka en timme.
Kriteriet, liksom D' (se ovan), beräknas från z(TP) och z(FP). Kriterium ( c ) = (z(TP)+z(FP))/-2. Ett värde på noll innebär att observatören är lika benägen att ge ett positivt (t.ex. 'mål närvarande') svar som ett negativt (frånvarande) svar. Positiva värden innebär att observatören är mer benägen att säga "frånvarande" (ett "konservativt" kriterium). Negativa värden innebär att observatören är mer benägen att säga "närvarande" (ett "liberalt" kriterium). Liberala och konservativa har i detta fall inga politiska konnotationer. Kriterievärden ligger nästan alltid mellan -2 och 2.
Data samlas in under ett pass på cirka en timme.

Sekundära resultatmått

Resultatmått
Åtgärdsbeskrivning
Tidsram
Reaktionstid
Tidsram: Data samlas in under en session på cirka en timme.
Detta är ett mått på hur lång tid det tar att göra ett svar.
Data samlas in under en session på cirka en timme.

Samarbetspartners och utredare

Det är här du hittar personer och organisationer som är involverade i denna studie.

Utredare

  • Huvudutredare: Jeremy M Wolfe, PhD, Brigham and Women's Hospital

Studieavstämningsdatum

Dessa datum spårar framstegen för inlämningar av studieposter och sammanfattande resultat till ClinicalTrials.gov. Studieposter och rapporterade resultat granskas av National Library of Medicine (NLM) för att säkerställa att de uppfyller specifika kvalitetskontrollstandarder innan de publiceras på den offentliga webbplatsen.

Studera stora datum

Studiestart (Faktisk)

1 januari 2020

Primärt slutförande (Faktisk)

1 augusti 2024

Avslutad studie (Faktisk)

4 november 2025

Studieregistreringsdatum

Först inskickad

18 februari 2022

Först inskickad som uppfyllde QC-kriterierna

28 februari 2022

Första postat (Faktisk)

9 mars 2022

Uppdateringar av studier

Senaste uppdatering publicerad (Faktisk)

20 januari 2026

Senaste inskickade uppdateringen som uppfyllde QC-kriterierna

29 december 2025

Senast verifierad

1 december 2025

Mer information

Termer relaterade till denna studie

Ytterligare relevanta MeSH-villkor

Andra studie-ID-nummer

  • 2007P000646-B
  • R01CA207490 (U.S.S. NIH-anslag/kontrakt)

Plan för individuella deltagardata (IPD)

Planerar du att dela individuella deltagardata (IPD)?

JA

IPD-planbeskrivning

Avidentifierade rådata kommer att publiceras på experimentets OSF-sida och kommer även att vara tillgängliga på begäran till PI.

Tidsram för IPD-delning

Material kommer att finnas tillgängligt på begäran

Kriterier för IPD Sharing Access

i huvudsak obegränsad

IPD-delning som stöder informationstyp

  • STUDY_PROTOCOL
  • SAV
  • ICF

Läkemedels- och apparatinformation, studiedokument

Studerar en amerikansk FDA-reglerad läkemedelsprodukt

Nej

Studerar en amerikansk FDA-reglerad produktprodukt

Nej

Denna information hämtades direkt från webbplatsen clinicaltrials.gov utan några ändringar. Om du har några önskemål om att ändra, ta bort eller uppdatera dina studieuppgifter, vänligen kontakta register@clinicaltrials.gov. Så snart en ändring har implementerats på clinicaltrials.gov, kommer denna att uppdateras automatiskt även på vår webbplats .

Prenumerera