- ICH GCP
- Registro de ensaios clínicos dos EUA
- Ensaio Clínico NCT05272189
Exemplo de Projeto 3: Testador de Colaboração Humano-IA (HAICT) Exp. 7
Visão geral do estudo
Status
Intervenção / Tratamento
Descrição detalhada
Este texto é o texto do pré-registro para o experimento HAICT 7 conforme descrito no Open Science Framework. https://osf.io/hngu4/
NOTA: Este estudo é representativo dos estudos realizados no Projeto 3 desta concessão. Existem vários experimentos no pacote de experimentos representado pelo Projeto 3, mas não é possível registrar um pacote de estudos no CT.gov.
NOTA: Como o comentário do pronome é consultivo, vamos deixá-lo por enquanto.
Testador de Colaboração Humano-IA (HAICT) Exp. 7 (ligeiramente editado de OSF)
Coleção de dados. Já foram coletados dados para este estudo? (Sim não)
sim
- Hipótese. Qual é a principal pergunta ou hipótese sendo testada neste estudo?
Antecedentes: Em uma variedade de experimentos de busca, tanto básicos quanto clínicos, os dados têm sido consistentes com uma situação em que a variabilidade do sinal (ou alvo) é maior do que a variabilidade do ruído (distratores). O sinal clássico disso é uma função zROC com uma inclinação < 1 - normalmente em torno de 0,6. Uma inclinação de 1,0 é indicativa de uma tarefa 2AFC de variância igual. Para a tarefa HAICT que estamos testando, esperaríamos uma variância igual, mas achamos que valeria a pena verificar, então vamos variar sistematicamente a prevalência que mudará o critério. Isso varrerá uma curva ROC que podemos examinar.
Também testaremos a IA falsa do Segundo Leitor para determinar se a baixa prevalência piora o Segundo Leitor.
- (H1): Esperamos replicar a descoberta de que os critérios humanos se tornam mais conservadores à medida que a prevalência diminui.
- (H2): Prevemos que a inclinação do zROC resultante será 1,0.
(H3): Nossa hipótese é que a baixa prevalência tornará o Second Reader AI menos eficaz porque o valor preditivo positivo de seus comentários será baixo.
Variável dependente. Descreva as principais variáveis dependentes, especificando como elas serão medidas.
As principais variáveis dependentes de interesse são precisão (e as derivadas de detecção de sinal de precisão, d' e c), tempo de reação e classificações subjetivas na pesquisa após cada bloco.
- Condições. A quantos e quais condições serão atribuídos os participantes?
Esta série de experimentos investiga como alterar a entrada de uma IA simulada pode afetar as decisões tomadas por observadores humanos em uma tarefa de escolha forçada de duas alternativas (como a decisão de chamar de volta uma mulher para um exame mais aprofundado na mamografia). Desenvolvemos um paradigma chamado Human-AI Collaboration Tester (HAICT) que permite o teste eficiente de interações entre um ser humano e uma IA simulada.
A tarefa dos observadores em todas as condições é fornecer uma decisão 2AFC sobre se um estímulo é "ruim" ou "não é ruim". Para usar uma linguagem que imita aproximadamente um diagnóstico médico, cada estímulo é referido como um "caso". Os observadores são solicitados a tomar uma decisão 2AFC sobre matrizes de formas coloridas. A decisão é tomada com base na cor predominante da caixa. O número de elementos de cada cor é extraído de uma das duas distribuições normais, uma para estímulos positivos (ruins) e outra para estímulos negativos (não ruins).
Os resultados de experimentos HAICT anteriores (3 e 4) mostraram que o desempenho humano na condição de Segundo Leitor cai significativamente em baixa prevalência. O desempenho na condição de Segundo Leitor foi melhor do que na linha de base quando a prevalência de casos graves era de 50%, mas foi significativamente pior do que na linha de base quando a prevalência era de apenas 10%. Neste experimento, manipulamos a prevalência de casos "ruins" nas condições do Segundo Leitor e da Linha de Base. Serão testadas quatro taxas de prevalência diferentes - 10%, 33%, 67% e 90%. Os observadores completarão 8 blocos (2 regras de IA x 4 taxas de prevalência) e a ordem dos blocos é aleatória.
Regras de IA a serem testadas:
- Linha de base - Sem entrada AI. O Observer classifica cada caso como "ruim" ou "não" ruim por conta própria.
Segundo Leitor - O observador toma uma decisão inicial sobre cada caso. O AI classifica silenciosamente os estímulos usando um critério conservador (c = 0,5). A lógica para o critério conservador é que o segundo leitor está sendo usado para reduzir as respostas falso-positivas e, portanto, pretende-se questionar as respostas humanas positivas que podem ser marginais. Se o observador e a IA discordarem, a IA informa o observador humano. O observador tem então a chance de mudar sua resposta ou seguir sua primeira opinião.
Como nas Experiências 1-5, o AI d-prime é fixado em 2,2. O feedback é conhecido por aumentar o efeito de prevalência, então o feedback será dado tanto na prática quanto nas tentativas de teste. Os observadores completarão 20 tentativas práticas e 200 tentativas de teste em cada bloco. Imediatamente após a conclusão de cada bloco, os observadores verão um resumo de seu desempenho. Após os blocos do Segundo Leitor, eles também serão solicitados a responder a três perguntas subjetivas sobre a utilidade da IA (consulte "Arquivos" para obter mais detalhes).
Análises. Especifique exatamente quais análises você realizará para examinar a questão/hipótese principal.
Primeiro, resumimos o número de acertos, verdadeiros negativos, erros e alarmes falsos em cada bloco. A partir disso, podemos calcular a precisão, o valor preditivo positivo, a sensibilidade (d-prime) e o critério para cada observador em cada uma das diferentes condições. Dadas as medidas de desempenho em 4 níveis de prevalência, podemos estimar a curva ROC (pHit x pFA) e a função zROC (zHit x zFA). Testaremos a hipótese de que a inclinação do zROC é igual a 1 (consequência de uma tarefa 2AFC de variância igual).
Mais análises. Alguma análise secundária?
Veremos se as opiniões subjetivas dos observadores sobre a IA estão correlacionadas com variáveis como o d-prime empírico ou o valor preditivo positivo.
Tamanho da amostra. Quantas observações serão coletadas ou o que determinará o tamanho da amostra? Não há necessidade de justificar a decisão, mas seja preciso sobre exatamente como o número será determinado.
Vamos testar 12 observadores. Isso é consistente com os tamanhos de amostra de experimentos anteriores.
- Outro. Há mais alguma coisa que você gostaria de pré-registrar? (por exemplo, exclusões de dados, variáveis coletadas para fins exploratórios, análises incomuns planejadas?)
N / D
Tipo de estudo
Inscrição (Real)
Estágio
- Não aplicável
Contactos e Locais
Locais de estudo
-
-
Massachusetts
-
Boston, Massachusetts, Estados Unidos, 02215
- Visual Attention Lab / Brigham and Women's Hospital
-
-
Critérios de participação
Critérios de elegibilidade
Idades elegíveis para estudo
Aceita Voluntários Saudáveis
Descrição
Critério de inclusão:
- - Todos bem-vindos para se inscrever on-line
Critério de exclusão:
- Deve passar no teste de triagem de visão colorida de Ishihara
- Visão 20/25 (com correção)
Plano de estudo
Como o estudo é projetado?
Detalhes do projeto
- Finalidade Principal: Ciência básica
- Alocação: N / D
- Modelo Intervencional: Atribuição de grupo único
- Mascaramento: Nenhum (rótulo aberto)
Armas e Intervenções
Grupo de Participantes / Braço |
Intervenção / Tratamento |
|---|---|
|
Experimental: Experimentar
Todos os participantes são testados em todas as condições deste experimento.
|
Neste experimento, em algumas condições, o participante toma sua decisão na presença de informações sobre uma decisão simulada de inteligência artificial.
A frequência com que as metas são apresentadas varia de 10% a 90%
Outros nomes:
|
O que o estudo está medindo?
Medidas de resultados primários
Medida de resultado |
Descrição da medida |
Prazo |
|---|---|---|
|
D'
Prazo: Os dados são recolhidos durante uma sessão de aproximadamente uma hora.
|
D' (d-prime) é a medida da teoria da deteção do sinal do nível de desempenho numa tarefa.
É calculado determinando a proporção de respostas verdadeiramente positivas =(ensaios verdadeiramente positivos)/(ensaios verdadeiramente positivos + ensaios falsamente negativos) = p(TP) e determinando a proporção de respostas falsamente positivas =(ensaios falsamente positivos)/(ensaios falsamente positivos + ensaios verdadeiramente negativos) = p(FP).
Estes valores são transformados em 'pontuações-z' (por exemplo, utilizando NORMSINV no Excel para calcular o inverso da distribuição normal padrão).
D' é definido como Z(TP)-Z(FP).
A sua gama vai de 0, para casos em que nenhum sinal pode ser discriminado do ruído, até ~4,0.
O limite superior não está definido, mas 4 significaria que um observador é essencialmente perfeito a discriminar o sinal do ruído.
|
Os dados são recolhidos durante uma sessão de aproximadamente uma hora.
|
|
Critério
Prazo: Os dados são recolhidos numa sessão de cerca de uma hora.
|
O critério, como D' (ver acima) é calculado a partir de z(TP) e z(FP).
Critério ( c ) = (z(TP)+z(FP))/-2.
Um valor de zero significa que o observador tem igual probabilidade de dar uma resposta positiva (por exemplo, 'alvo presente') como uma resposta negativa (ausente).
Valores positivos significam que o observador tem maior probabilidade de dizer "ausente" (um critério "conservador").
Valores negativos significam que o observador tem maior probabilidade de dizer "presente" (um critério "liberal").
Liberal e conservador não têm conotações políticas neste caso.
Os valores do critério quase sempre se situam entre -2 e 2.
|
Os dados são recolhidos numa sessão de cerca de uma hora.
|
Medidas de resultados secundários
Medida de resultado |
Descrição da medida |
Prazo |
|---|---|---|
|
Tempo de Reação
Prazo: Os dados são recolhidos numa sessão de cerca de uma hora.
|
Esta é a medida de quanto tempo demora a dar uma resposta.
|
Os dados são recolhidos numa sessão de cerca de uma hora.
|
Colaboradores e Investigadores
Patrocinador
Colaboradores
Investigadores
- Investigador principal: Jeremy M Wolfe, PhD, Brigham and Women's Hospital
Datas de registro do estudo
Datas Principais do Estudo
Início do estudo (Real)
Conclusão Primária (Real)
Conclusão do estudo (Real)
Datas de inscrição no estudo
Enviado pela primeira vez
Enviado pela primeira vez que atendeu aos critérios de CQ
Primeira postagem (Real)
Atualizações de registro de estudo
Última Atualização Postada (Real)
Última atualização enviada que atendeu aos critérios de controle de qualidade
Última verificação
Mais Informações
Termos relacionados a este estudo
Palavras-chave
Termos MeSH relevantes adicionais
Outros números de identificação do estudo
- 2007P000646-B
- R01CA207490 (Concessão/Contrato do NIH dos EUA)
Plano para dados de participantes individuais (IPD)
Planeja compartilhar dados de participantes individuais (IPD)?
Descrição do plano IPD
Prazo de Compartilhamento de IPD
Critérios de acesso de compartilhamento IPD
Tipo de informação de suporte de compartilhamento de IPD
- PROTOCOLO DE ESTUDO
- SEIVA
- CIF
Informações sobre medicamentos e dispositivos, documentos de estudo
Estuda um medicamento regulamentado pela FDA dos EUA
Estuda um produto de dispositivo regulamentado pela FDA dos EUA
Essas informações foram obtidas diretamente do site clinicaltrials.gov sem nenhuma alteração. Se você tiver alguma solicitação para alterar, remover ou atualizar os detalhes do seu estudo, entre em contato com register@clinicaltrials.gov. Assim que uma alteração for implementada em clinicaltrials.gov, ela também será atualizada automaticamente em nosso site .