Deze pagina is automatisch vertaald en de nauwkeurigheid van de vertaling kan niet worden gegarandeerd. Raadpleeg de Engelse versie voor een brontekst.

Project 3 Voorbeeld: Human-AI Collaboration Tester (HAICT) Exp. 7

29 december 2025 bijgewerkt door: Jeremy M Wolfe, PhD, Brigham and Women's Hospital
De studie maakt deel uit van een "bundel" van experimenten die deel uitmaken van project drie van een subsidie ​​​​van het National Eye Institute. Project Drie omvat een reeks experimenten die onderzoeken hoe het veranderen van de input van een gesimuleerde AI de beslissingen van menselijke waarnemers kan beïnvloeden in een twee-alternatieve gedwongen keuzetaak (zoals de beslissing om een ​​vrouw terug te roepen voor verder onderzoek in mammografie). HAICT 7, het hier beschreven experiment, onderzoekt hoe veranderende prevalentie de menselijke prestaties beïnvloedt wanneer AI wordt gebruikt als tweede lezer.

Studie Overzicht

Gedetailleerde beschrijving

Deze tekst is de tekst van de pre-registratie voor het HAICT 7 experiment zoals beschreven op het Open Science Framework. https://osf.io/hngu4/

OPMERKING: Deze studie is representatief voor studies die zijn uitgevoerd in Project 3 van deze subsidie. Er zijn meerdere experimenten in de bundel experimenten die wordt weergegeven door Project 3, maar het is niet mogelijk om een ​​bundel studies te registreren op CT.gov.

OPMERKING: aangezien de opmerking bij het voornaamwoord adviserend is, laten we het voorlopig staan.

Human-AI Collaboration Tester (HAICT) Exp. 7 (licht bewerkt vanuit OSF)

  1. Gegevensverzameling. Zijn er al gegevens verzameld voor dit onderzoek? (Ja nee)

    Ja

  2. Hypothese. Wat is de belangrijkste vraag die wordt gesteld of de hypothese die wordt getest in deze studie?

Achtergrond: In een verscheidenheid aan zoekexperimenten, zowel basis- als klinische, kwamen de gegevens overeen met een situatie waarin de variabiliteit van het signaal (of doelwit) groter is dan de variabiliteit van de ruis (afleiders). Het klassieke teken hiervan is een zROC-functie met een helling < 1 - meestal rond de 0,6. Een helling van 1,0 is indicatief voor een 2AFC-taak met gelijke variantie. Voor de HAICT-taak die we hebben getest, zouden we een gelijke variantie verwachten, maar we denken dat het de moeite waard is om te controleren, dus we zullen de prevalentie systematisch variëren, waardoor het criterium zal verschuiven. Dat zal een ROC-curve opleveren die we kunnen onderzoeken.

We zullen ook de nep-AI van Second Reader testen om te bepalen of een lage prevalentie Second Reader erger maakt.

  • (H1): We verwachten de bevinding te repliceren dat menselijke criteria conservatiever worden naarmate de prevalentie afneemt.
  • (H2): We voorspellen dat de helling van de resulterende zROC 1,0 zal zijn.
  • (H3): We veronderstellen dat een lage prevalentie Second Reader AI minder effectief zal maken omdat de positief voorspellende waarde van de commentaren laag zal zijn.

    1. Afhankelijke variabele. Beschrijf de belangrijkste afhankelijke variabele(n) en specificeer hoe ze zullen worden gemeten.

      De belangrijkste afhankelijke variabelen die van belang zijn, zijn nauwkeurigheid (en de signaaldetectiederivaten van nauwkeurigheid, d' en c), reactietijd en subjectieve beoordelingen op het onderzoek na elk blok.

    2. Voorwaarden. Aan hoeveel en aan welke voorwaarden worden deelnemers toegewezen?

Deze reeks experimenten onderzoekt hoe het veranderen van de invoer van een gesimuleerde AI de beslissingen kan beïnvloeden die door menselijke waarnemers worden genomen in een twee-alternatieve gedwongen keuzetaak (zoals de beslissing om een ​​vrouw terug te roepen voor verder onderzoek in mammografie). We hebben een paradigma ontwikkeld, de Human-AI Collaboration Tester (HAICT), waarmee interacties tussen een mens en een gesimuleerde AI efficiënt kunnen worden getest.

De taak van de waarnemers is onder alle omstandigheden om een ​​2AFC-beslissing te geven over de vraag of een stimulus "slecht" of "niet slecht" is. Om taal te gebruiken die grofweg een medische diagnose nabootst, wordt elke stimulus een 'geval' genoemd. Waarnemers wordt gevraagd om een ​​2AFC-beslissing te nemen over reeksen gekleurde vormen. De beslissing wordt genomen op basis van de overheersende kleur van de behuizing. Het aantal elementen van elke kleur wordt ontleend aan een van de twee normale verdelingen, één voor positieve (slechte) stimuli en de andere voor negatieve (niet slechte) stimuli.

De resultaten van eerdere HAICT-experimenten (3 en 4) toonden aan dat menselijke prestaties in de Second Reader-conditie aanzienlijk afnemen bij een lage prevalentie. De prestatie in de Second Reader-conditie was beter dan Baseline wanneer de prevalentie van slechte gevallen 50% was, maar was significant slechter dan Baseline wanneer de prevalentie slechts 10% was. In dit experiment manipuleren we de prevalentie van "slechte" gevallen in de Second Reader- en Baseline-condities. Er worden vier verschillende prevalentiepercentages getest: 10%, 33%, 67% en 90%. Waarnemers voltooien 8 blokken (2 AI-regels x 4 prevalentiecijfers) en de blokvolgorde is willekeurig.

AI-regels die getest moeten worden:

  1. Baseline - Geen AI-invoer. Observer classificeert elk geval afzonderlijk als "slecht" of "niet" slecht.
  2. Tweede lezer - De waarnemer neemt een eerste beslissing over elk geval. De AI classificeert stilletjes stimuli met behulp van een conservatief criterium (c = 0,5). De logica voor het conservatieve criterium is dat de tweede lezer wordt gebruikt om het aantal fout-positieve reacties te verminderen en dat het dus de bedoeling is om positieve menselijke reacties in twijfel te trekken die marginaal kunnen zijn. Als de waarnemer en AI het niet eens zijn, informeert de AI de menselijke waarnemer. De waarnemer krijgt dan de kans om zijn reactie te wijzigen of zijn eerste mening te volgen.

    Net als in Experimenten 1-5 is de AI d-prime vastgesteld op 2,2. Van feedback is bekend dat het het prevalentie-effect vergroot, dus feedback zal zowel in de praktijk als in de testtrials worden gegeven. Waarnemers zullen in elk blok 20 oefenpogingen en 200 testpogingen voltooien. Onmiddellijk nadat elk blok is voltooid, krijgen waarnemers een samenvatting van hun prestaties te zien. Na de Second Reader-blokken wordt hen ook gevraagd om drie subjectieve vragen over het nut van de AI te beantwoorden (zie "Bestanden" voor meer details).

  3. Analyses. Geef precies aan welke analyses je gaat uitvoeren om de hoofdvraag/hypothese te onderzoeken.

    Eerst vatten we het aantal treffers, echte negatieven, missers en valse alarmen in elk blok samen. Hieruit kunnen we de nauwkeurigheid, de positief voorspellende waarde, de gevoeligheid (d-prime) en het criterium voor elke waarnemer onder elk van de verschillende omstandigheden berekenen. Gegeven prestatiemetingen op 4 prevalentieniveaus, kunnen we de ROC-curve (pHit x pFA) en de zROC-functie (zHit x zFA) schatten. We testen de hypothese dat de helling van de zROC gelijk is aan 1 (het gevolg van een 2AFC-taak met gelijke variantie).

  4. Meer analyses. Secundaire analyses?

    We zullen kijken of de subjectieve meningen van de waarnemers over de AI gecorreleerd zijn met variabelen zoals de empirische d-prime, of de positief voorspellende waarde.

  5. Steekproefgrootte. Hoeveel waarnemingen worden er verzameld of wat bepaalt de steekproefomvang? U hoeft de beslissing niet te rechtvaardigen, maar wees precies hoe het aantal precies zal worden bepaald.

    We zullen 12 waarnemers testen. Dit komt overeen met de steekproefomvang van eerdere experimenten.

  6. Ander. Is er nog iets dat u vooraf wilt aanmelden? (bijv. gegevensuitsluitingen, variabelen verzameld voor verkennende doeleinden, ongebruikelijke analyses gepland?)

NVT

Studietype

Ingrijpend

Inschrijving (Werkelijk)

12

Fase

  • Niet toepasbaar

Contacten en locaties

In dit gedeelte vindt u de contactgegevens van degenen die het onderzoek uitvoeren en informatie over waar dit onderzoek wordt uitgevoerd.

Studie Locaties

    • Massachusetts
      • Boston, Massachusetts, Verenigde Staten, 02215
        • Visual Attention Lab / Brigham and Women's Hospital

Deelname Criteria

Onderzoekers zoeken naar mensen die aan een bepaalde beschrijving voldoen, de zogenaamde geschiktheidscriteria. Enkele voorbeelden van deze criteria zijn iemands algemene gezondheidstoestand of eerdere behandelingen.

Geschiktheidscriteria

Leeftijden die in aanmerking komen voor studie

18 jaar en ouder (Volwassen, Oudere volwassene)

Accepteert gezonde vrijwilligers

Ja

Beschrijving

Inclusiecriteria:

  • - Iedereen welkom om online in te schrijven

Uitsluitingscriteria:

  • Moet slagen voor de Ishihara-screeningtest voor kleurenzicht
  • 20/25 zicht (met correctie)

Studie plan

Dit gedeelte bevat details van het studieplan, inclusief hoe de studie is opgezet en wat de studie meet.

Hoe is de studie opgezet?

Ontwerpdetails

  • Primair doel: Fundamentele wetenschap
  • Toewijzing: NVT
  • Interventioneel model: Opdracht voor een enkele groep
  • Masker: Geen (open label)

Wapens en interventies

Deelnemersgroep / Arm
Interventie / Behandeling
Experimenteel: Experiment
Alle deelnemers worden getest in alle omstandigheden van dit experiment.
In dit experiment neemt de deelnemer onder bepaalde omstandigheden zijn beslissing in aanwezigheid van informatie over een gesimuleerde kunstmatige intelligentiebeslissing.
De frequentie waarmee targets worden gepresenteerd varieert van 10% tot 90%
Andere namen:
  • Basistarief

Wat meet het onderzoek?

Primaire uitkomstmaten

Uitkomstmaat
Maatregel Beschrijving
Tijdsspanne
D'
Tijdsspanne: Gegevens worden verzameld binnen een sessie van ongeveer een uur.
D' (d-prime) is de signaaldetectietheorie-maatstaf voor het prestatiepeil bij een taak. Het wordt berekend door het aandeel van de juiste positieve reacties te bepalen = (juiste positieve proeven)/(juiste positieve + fout-negatieve proeven) = p(TP) en door het aandeel van de fout-positieve reacties te bepalen = (fout-positieve proeven)/(fout-positieve + juiste negatieve proeven) = p(FP). Deze waarden worden omgezet in 'z-scores' (bijvoorbeeld met NORMSINV in Excel om de inverse van de standaardnormale verdeling te berekenen). D' wordt gedefinieerd als Z(TP)-Z(FP). Het bereik gaat van 0 voor gevallen waarin geen signaal kan worden onderscheiden van de ruis, tot ~4,0. De bovengrens is niet gedefinieerd, maar 4 zou betekenen dat een waarnemer in wezen perfect is in het onderscheiden van signaal van ruis.
Gegevens worden verzameld binnen een sessie van ongeveer een uur.
Criterium
Tijdsspanne: De gegevens worden verzameld binnen een sessie van ongeveer een uur.
Criterium, zoals D' (zie hierboven) wordt berekend uit z(TP) en z(FP). Criterium ( c ) = (z(TP)+z(FP))/-2. Een waarde van nul betekent dat de waarnemer even waarschijnlijk een positieve (bijv. 'doelwit aanwezig') respons geeft als een negatieve (afwezige) respons. Positieve waarden betekenen dat de waarnemer eerder geneigd is "afwezig" te zeggen (een "conservatief" criterium). Negatieve waarden betekenen dat de waarnemer eerder geneigd is "aanwezig" te zeggen (een "liberaal" criterium). Liberaal en conservatief hebben in dit geval geen politieke connotaties. Criteriumwaarden vallen bijna altijd tussen -2 en 2.
De gegevens worden verzameld binnen een sessie van ongeveer een uur.

Secundaire uitkomstmaten

Uitkomstmaat
Maatregel Beschrijving
Tijdsspanne
Reactietijd
Tijdsspanne: De gegevens worden verzameld binnen een sessie van ongeveer een uur.
Dit is de maatstaf voor hoe lang het duurt om een antwoord te geven.
De gegevens worden verzameld binnen een sessie van ongeveer een uur.

Medewerkers en onderzoekers

Hier vindt u mensen en organisaties die betrokken zijn bij dit onderzoek.

Onderzoekers

  • Hoofdonderzoeker: Jeremy M Wolfe, PhD, Brigham and Women's Hospital

Studie record data

Deze datums volgen de voortgang van het onderzoeksdossier en de samenvatting van de ingediende resultaten bij ClinicalTrials.gov. Studieverslagen en gerapporteerde resultaten worden beoordeeld door de National Library of Medicine (NLM) om er zeker van te zijn dat ze voldoen aan specifieke kwaliteitscontrolenormen voordat ze op de openbare website worden geplaatst.

Bestudeer belangrijke data

Studie start (Werkelijk)

1 januari 2020

Primaire voltooiing (Werkelijk)

1 augustus 2024

Studie voltooiing (Werkelijk)

4 november 2025

Studieregistratiedata

Eerst ingediend

18 februari 2022

Eerst ingediend dat voldeed aan de QC-criteria

28 februari 2022

Eerst geplaatst (Werkelijk)

9 maart 2022

Updates van studierecords

Laatste update geplaatst (Werkelijk)

20 januari 2026

Laatste update ingediend die voldeed aan QC-criteria

29 december 2025

Laatst geverifieerd

1 december 2025

Meer informatie

Termen gerelateerd aan deze studie

Aanvullende relevante MeSH-voorwaarden

Andere studie-ID-nummers

  • 2007P000646-B
  • R01CA207490 (Subsidie/contract van de Amerikaanse NIH)

Plan Individuele Deelnemersgegevens (IPD)

Bent u van plan om gegevens van individuele deelnemers (IPD) te delen?

JA

Beschrijving IPD-plan

Geanonimiseerde onbewerkte gegevens worden op de OSF-pagina van het experiment geplaatst en zijn op verzoek ook beschikbaar voor de PI.

IPD-tijdsbestek voor delen

Materialen zijn beschikbaar op aanvraag

IPD-toegangscriteria voor delen

in wezen onbeperkt

IPD delen Ondersteunend informatietype

  • LEERPROTOCOOL
  • SAP
  • ICF

Informatie over medicijnen en apparaten, studiedocumenten

Bestudeert een door de Amerikaanse FDA gereguleerd geneesmiddel

Nee

Bestudeert een door de Amerikaanse FDA gereguleerd apparaatproduct

Nee

Deze informatie is zonder wijzigingen rechtstreeks van de website clinicaltrials.gov gehaald. Als u verzoeken heeft om uw onderzoeksgegevens te wijzigen, te verwijderen of bij te werken, neem dan contact op met register@clinicaltrials.gov. Zodra er een wijziging wordt doorgevoerd op clinicaltrials.gov, wordt deze ook automatisch bijgewerkt op onze website .

Abonneren