Esta página foi traduzida automaticamente e a precisão da tradução não é garantida. Por favor, consulte o versão em inglês para um texto fonte.

Exemplo de Projeto 3: Testador de Colaboração Humano-IA (HAICT) Exp. 7

29 de dezembro de 2025 atualizado por: Jeremy M Wolfe, PhD, Brigham and Women's Hospital
O estudo é parte de um "pacote" de experimentos que constituem o Projeto Três de uma bolsa do National Eye Institute. O Projeto Três inclui uma série de experimentos que investigam como alterar a entrada de uma IA simulada pode afetar as decisões tomadas por observadores humanos em uma tarefa de escolha forçada de duas alternativas (como a decisão de chamar de volta uma mulher para um exame mais aprofundado na mamografia). HAICT 7, o experimento descrito aqui, investiga como a mudança de prevalência afeta o desempenho humano quando a IA é usada como um segundo leitor.

Visão geral do estudo

Descrição detalhada

Este texto é o texto do pré-registro para o experimento HAICT 7 conforme descrito no Open Science Framework. https://osf.io/hngu4/

NOTA: Este estudo é representativo dos estudos realizados no Projeto 3 desta concessão. Existem vários experimentos no pacote de experimentos representado pelo Projeto 3, mas não é possível registrar um pacote de estudos no CT.gov.

NOTA: Como o comentário do pronome é consultivo, vamos deixá-lo por enquanto.

Testador de Colaboração Humano-IA (HAICT) Exp. 7 (ligeiramente editado de OSF)

  1. Coleção de dados. Já foram coletados dados para este estudo? (Sim não)

    sim

  2. Hipótese. Qual é a principal pergunta ou hipótese sendo testada neste estudo?

Antecedentes: Em uma variedade de experimentos de busca, tanto básicos quanto clínicos, os dados têm sido consistentes com uma situação em que a variabilidade do sinal (ou alvo) é maior do que a variabilidade do ruído (distratores). O sinal clássico disso é uma função zROC com uma inclinação < 1 - normalmente em torno de 0,6. Uma inclinação de 1,0 é indicativa de uma tarefa 2AFC de variância igual. Para a tarefa HAICT que estamos testando, esperaríamos uma variância igual, mas achamos que valeria a pena verificar, então vamos variar sistematicamente a prevalência que mudará o critério. Isso varrerá uma curva ROC que podemos examinar.

Também testaremos a IA falsa do Segundo Leitor para determinar se a baixa prevalência piora o Segundo Leitor.

  • (H1): Esperamos replicar a descoberta de que os critérios humanos se tornam mais conservadores à medida que a prevalência diminui.
  • (H2): Prevemos que a inclinação do zROC resultante será 1,0.
  • (H3): Nossa hipótese é que a baixa prevalência tornará o Second Reader AI menos eficaz porque o valor preditivo positivo de seus comentários será baixo.

    1. Variável dependente. Descreva as principais variáveis ​​dependentes, especificando como elas serão medidas.

      As principais variáveis ​​dependentes de interesse são precisão (e as derivadas de detecção de sinal de precisão, d' e c), tempo de reação e classificações subjetivas na pesquisa após cada bloco.

    2. Condições. A quantos e quais condições serão atribuídos os participantes?

Esta série de experimentos investiga como alterar a entrada de uma IA simulada pode afetar as decisões tomadas por observadores humanos em uma tarefa de escolha forçada de duas alternativas (como a decisão de chamar de volta uma mulher para um exame mais aprofundado na mamografia). Desenvolvemos um paradigma chamado Human-AI Collaboration Tester (HAICT) que permite o teste eficiente de interações entre um ser humano e uma IA simulada.

A tarefa dos observadores em todas as condições é fornecer uma decisão 2AFC sobre se um estímulo é "ruim" ou "não é ruim". Para usar uma linguagem que imita aproximadamente um diagnóstico médico, cada estímulo é referido como um "caso". Os observadores são solicitados a tomar uma decisão 2AFC sobre matrizes de formas coloridas. A decisão é tomada com base na cor predominante da caixa. O número de elementos de cada cor é extraído de uma das duas distribuições normais, uma para estímulos positivos (ruins) e outra para estímulos negativos (não ruins).

Os resultados de experimentos HAICT anteriores (3 e 4) mostraram que o desempenho humano na condição de Segundo Leitor cai significativamente em baixa prevalência. O desempenho na condição de Segundo Leitor foi melhor do que na linha de base quando a prevalência de casos graves era de 50%, mas foi significativamente pior do que na linha de base quando a prevalência era de apenas 10%. Neste experimento, manipulamos a prevalência de casos "ruins" nas condições do Segundo Leitor e da Linha de Base. Serão testadas quatro taxas de prevalência diferentes - 10%, 33%, 67% e 90%. Os observadores completarão 8 blocos (2 regras de IA x 4 taxas de prevalência) e a ordem dos blocos é aleatória.

Regras de IA a serem testadas:

  1. Linha de base - Sem entrada AI. O Observer classifica cada caso como "ruim" ou "não" ruim por conta própria.
  2. Segundo Leitor - O observador toma uma decisão inicial sobre cada caso. O AI classifica silenciosamente os estímulos usando um critério conservador (c = 0,5). A lógica para o critério conservador é que o segundo leitor está sendo usado para reduzir as respostas falso-positivas e, portanto, pretende-se questionar as respostas humanas positivas que podem ser marginais. Se o observador e a IA discordarem, a IA informa o observador humano. O observador tem então a chance de mudar sua resposta ou seguir sua primeira opinião.

    Como nas Experiências 1-5, o AI d-prime é fixado em 2,2. O feedback é conhecido por aumentar o efeito de prevalência, então o feedback será dado tanto na prática quanto nas tentativas de teste. Os observadores completarão 20 tentativas práticas e 200 tentativas de teste em cada bloco. Imediatamente após a conclusão de cada bloco, os observadores verão um resumo de seu desempenho. Após os blocos do Segundo Leitor, eles também serão solicitados a responder a três perguntas subjetivas sobre a utilidade da IA ​​(consulte "Arquivos" para obter mais detalhes).

  3. Análises. Especifique exatamente quais análises você realizará para examinar a questão/hipótese principal.

    Primeiro, resumimos o número de acertos, verdadeiros negativos, erros e alarmes falsos em cada bloco. A partir disso, podemos calcular a precisão, o valor preditivo positivo, a sensibilidade (d-prime) e o critério para cada observador em cada uma das diferentes condições. Dadas as medidas de desempenho em 4 níveis de prevalência, podemos estimar a curva ROC (pHit x pFA) e a função zROC (zHit x zFA). Testaremos a hipótese de que a inclinação do zROC é igual a 1 (consequência de uma tarefa 2AFC de variância igual).

  4. Mais análises. Alguma análise secundária?

    Veremos se as opiniões subjetivas dos observadores sobre a IA estão correlacionadas com variáveis ​​como o d-prime empírico ou o valor preditivo positivo.

  5. Tamanho da amostra. Quantas observações serão coletadas ou o que determinará o tamanho da amostra? Não há necessidade de justificar a decisão, mas seja preciso sobre exatamente como o número será determinado.

    Vamos testar 12 observadores. Isso é consistente com os tamanhos de amostra de experimentos anteriores.

  6. Outro. Há mais alguma coisa que você gostaria de pré-registrar? (por exemplo, exclusões de dados, variáveis ​​coletadas para fins exploratórios, análises incomuns planejadas?)

N / D

Tipo de estudo

Intervencional

Inscrição (Real)

12

Estágio

  • Não aplicável

Contactos e Locais

Esta seção fornece os detalhes de contato para aqueles que conduzem o estudo e informações sobre onde este estudo está sendo realizado.

Locais de estudo

    • Massachusetts
      • Boston, Massachusetts, Estados Unidos, 02215
        • Visual Attention Lab / Brigham and Women's Hospital

Critérios de participação

Os pesquisadores procuram pessoas que se encaixem em uma determinada descrição, chamada de critérios de elegibilidade. Alguns exemplos desses critérios são a condição geral de saúde de uma pessoa ou tratamentos anteriores.

Critérios de elegibilidade

Idades elegíveis para estudo

18 anos e mais velhos (Adulto, Adulto mais velho)

Aceita Voluntários Saudáveis

Sim

Descrição

Critério de inclusão:

  • - Todos bem-vindos para se inscrever on-line

Critério de exclusão:

  • Deve passar no teste de triagem de visão colorida de Ishihara
  • Visão 20/25 (com correção)

Plano de estudo

Esta seção fornece detalhes do plano de estudo, incluindo como o estudo é projetado e o que o estudo está medindo.

Como o estudo é projetado?

Detalhes do projeto

  • Finalidade Principal: Ciência básica
  • Alocação: N / D
  • Modelo Intervencional: Atribuição de grupo único
  • Mascaramento: Nenhum (rótulo aberto)

Armas e Intervenções

Grupo de Participantes / Braço
Intervenção / Tratamento
Experimental: Experimentar
Todos os participantes são testados em todas as condições deste experimento.
Neste experimento, em algumas condições, o participante toma sua decisão na presença de informações sobre uma decisão simulada de inteligência artificial.
A frequência com que as metas são apresentadas varia de 10% a 90%
Outros nomes:
  • Taxa de base

O que o estudo está medindo?

Medidas de resultados primários

Medida de resultado
Descrição da medida
Prazo
D'
Prazo: Os dados são recolhidos durante uma sessão de aproximadamente uma hora.
D' (d-prime) é a medida da teoria da deteção do sinal do nível de desempenho numa tarefa. É calculado determinando a proporção de respostas verdadeiramente positivas =(ensaios verdadeiramente positivos)/(ensaios verdadeiramente positivos + ensaios falsamente negativos) = p(TP) e determinando a proporção de respostas falsamente positivas =(ensaios falsamente positivos)/(ensaios falsamente positivos + ensaios verdadeiramente negativos) = p(FP). Estes valores são transformados em 'pontuações-z' (por exemplo, utilizando NORMSINV no Excel para calcular o inverso da distribuição normal padrão). D' é definido como Z(TP)-Z(FP). A sua gama vai de 0, para casos em que nenhum sinal pode ser discriminado do ruído, até ~4,0. O limite superior não está definido, mas 4 significaria que um observador é essencialmente perfeito a discriminar o sinal do ruído.
Os dados são recolhidos durante uma sessão de aproximadamente uma hora.
Critério
Prazo: Os dados são recolhidos numa sessão de cerca de uma hora.
O critério, como D' (ver acima) é calculado a partir de z(TP) e z(FP). Critério ( c ) = (z(TP)+z(FP))/-2. Um valor de zero significa que o observador tem igual probabilidade de dar uma resposta positiva (por exemplo, 'alvo presente') como uma resposta negativa (ausente). Valores positivos significam que o observador tem maior probabilidade de dizer "ausente" (um critério "conservador"). Valores negativos significam que o observador tem maior probabilidade de dizer "presente" (um critério "liberal"). Liberal e conservador não têm conotações políticas neste caso. Os valores do critério quase sempre se situam entre -2 e 2.
Os dados são recolhidos numa sessão de cerca de uma hora.

Medidas de resultados secundários

Medida de resultado
Descrição da medida
Prazo
Tempo de Reação
Prazo: Os dados são recolhidos numa sessão de cerca de uma hora.
Esta é a medida de quanto tempo demora a dar uma resposta.
Os dados são recolhidos numa sessão de cerca de uma hora.

Colaboradores e Investigadores

É aqui que você encontrará pessoas e organizações envolvidas com este estudo.

Investigadores

  • Investigador principal: Jeremy M Wolfe, PhD, Brigham and Women's Hospital

Datas de registro do estudo

Essas datas acompanham o progresso do registro do estudo e os envios de resumo dos resultados para ClinicalTrials.gov. Os registros do estudo e os resultados relatados são revisados ​​pela National Library of Medicine (NLM) para garantir que atendam aos padrões específicos de controle de qualidade antes de serem publicados no site público.

Datas Principais do Estudo

Início do estudo (Real)

1 de janeiro de 2020

Conclusão Primária (Real)

1 de agosto de 2024

Conclusão do estudo (Real)

4 de novembro de 2025

Datas de inscrição no estudo

Enviado pela primeira vez

18 de fevereiro de 2022

Enviado pela primeira vez que atendeu aos critérios de CQ

28 de fevereiro de 2022

Primeira postagem (Real)

9 de março de 2022

Atualizações de registro de estudo

Última Atualização Postada (Real)

20 de janeiro de 2026

Última atualização enviada que atendeu aos critérios de controle de qualidade

29 de dezembro de 2025

Última verificação

1 de dezembro de 2025

Mais Informações

Termos relacionados a este estudo

Termos MeSH relevantes adicionais

Outros números de identificação do estudo

  • 2007P000646-B
  • R01CA207490 (Concessão/Contrato do NIH dos EUA)

Plano para dados de participantes individuais (IPD)

Planeja compartilhar dados de participantes individuais (IPD)?

SIM

Descrição do plano IPD

Os dados brutos não identificados serão publicados na página OSF do experimento e também estarão disponíveis mediante solicitação ao PI.

Prazo de Compartilhamento de IPD

Os materiais estarão disponíveis quando solicitados

Critérios de acesso de compartilhamento IPD

essencialmente irrestrito

Tipo de informação de suporte de compartilhamento de IPD

  • PROTOCOLO DE ESTUDO
  • SEIVA
  • CIF

Informações sobre medicamentos e dispositivos, documentos de estudo

Estuda um medicamento regulamentado pela FDA dos EUA

Não

Estuda um produto de dispositivo regulamentado pela FDA dos EUA

Não

Essas informações foram obtidas diretamente do site clinicaltrials.gov sem nenhuma alteração. Se você tiver alguma solicitação para alterar, remover ou atualizar os detalhes do seu estudo, entre em contato com register@clinicaltrials.gov. Assim que uma alteração for implementada em clinicaltrials.gov, ela também será atualizada automaticamente em nosso site .

Se inscrever