このページは自動翻訳されたものであり、翻訳の正確性は保証されていません。を参照してください。 英語版 ソーステキスト用。

プロジェクト 3 例: Human-AI Collaboration Tester (HAICT) Exp. 7

2025年12月29日 更新者:Jeremy M Wolfe, PhD、Brigham and Women's Hospital
この研究は、国立眼科研究所の助成金のプロジェクト 3 を構成する実験の「束」の一部です。 プロジェクト 3 には、シミュレートされた AI からの入力の変更が、二者択一の強制選択タスクで人間の観察者が下す決定 (マンモグラフィーのさらなる検査のために女性を呼び戻す決定など) にどのような影響を与えるかを調査する一連の実験が含まれています。 ここで説明する実験である HAICT 7 は、AI がセカンド リーダーとして使用された場合に、普及率の変化が人間のパフォーマンスにどのような影響を与えるかを調査します。

調査の概要

詳細な説明

このテキストは、オープン サイエンス フレームワークに記載されている HAICT 7 実験の事前登録のテキストです。 https://osf.io/hngu4/

注: この研究は、この助成金のプロジェクト 3 で実施された研究の代表的なものです。 プロジェクト 3 で表される実験のバンドルには複数の実験がありますが、研究のバンドルを CT.gov に登録することはできません。

注: 代名詞のコメントは助言であるため、今のところはそのままにしておきます。

人とAIの連携テスター(HAICT)Exp. 7 (OSF から軽く編集)

  1. データ収集。 この研究のためにすでにデータが収集されていますか? (はい・いいえ)

    はい

  2. 仮説。 この研究で尋ねられている主な質問、または検証されている仮説は何ですか?

背景: 基礎的および臨床的なさまざまな探索実験において、データは信号 (またはターゲット) の変動がノイズ (妨害物質) の変動よりも大きい状況と一致しています。 この典型的な兆候は、傾きが 1 未満 (通常は約 0.6) の zROC 関数です。 傾き 1.0 は、等分散 2AFC タスクを示します。 私たちがテストしてきた HAICT タスクでは、等しい分散が期待されますが、チェックする価値があると考えられるため、基準を変更するために体系的に有病率を変更します。 これにより、検査できる ROC 曲線が作成されます。

また、普及率が低いと Second Reader が悪化するかどうかを判断するために、Second Reader の偽 AI もテストします。

  • (H1): 有病率が低下するにつれて人間の基準がより保守的になるという発見が再現されると期待しています。
  • (H2): 結果として得られる zROC の傾きは 1.0 になると予測します。
  • (H3): コメントの陽性的中率が低くなるため、普及率が低いと Second Reader AI の効果が低下すると仮説を立てます。

    1. 従属変数。 主要な従属変数を説明し、その測定方法を指定します。

      対象となる主な従属変数は、精度 (および精度の信号検出導関数、d' および c)、反応時間、および各ブロックに続く調査の主観的評価です。

    2. 条件。 参加者は何名、どの条件に割り当てられますか?

この一連の実験では、シミュレートされた AI からの入力の変更が、二者択一の強制選択タスクで人間の観察者が行う決定 (マンモグラフィーのさらなる検査のために女性を呼び戻す決定など) にどのような影響を与えるかを調査します。 私たちは、人間とシミュレートされた AI の間の相互作用の効率的なテストを可能にする Human-AI Collaboration Tester (HAICT) と呼ばれるパラダイムを開発しました。

あらゆる状況における観察者の任務は、刺激が「悪い」か「悪くない」かについて 2AFC の決定を下すことです。 医療診断を大まかに模倣した言葉を使用する場合、各刺激は「ケース」と呼ばれます。 観察者は、色付きの形状の配列について 2AFC の決定を行うように求められます。 決定はケースの主な色に基づいて行われます。 各色の要素の数は、2 つの正規分布のうちの 1 つから抽出されます。1 つはポジティブ (悪い) 刺激用、もう 1 つはネガティブ (悪くない) 刺激用です。

以前の HAICT 実験 (3 および 4) の結果は、Second Reader 条件における人間のパフォーマンスは、有病率が低い場合に大幅に低下することを示しました。 Second Reader 条件でのパフォーマンスは、不良ケースの有病率が 50% の場合はベースラインよりも優れていましたが、有病率がわずか 10% の場合はベースラインよりも大幅に悪かったです。 この実験では、Second Reader 条件と Baseline 条件における「悪い」ケースの蔓延を操作します。 4 つの異なる有病率 (10%、33%、67%、90%) がテストされます。 オブザーバーは 8 つのブロック (2 AI ルール x 4 普及率) を完了します。ブロックの順序はランダムです。

テストする AI ルール:

  1. ベースライン - AI 入力なし。 オブザーバーは、各ケースを独自に「悪い」または「悪くない」と分類します。
  2. セカンドリーダー - オブザーバーはあらゆるケースについて最初の決定を下します。 AI は、控えめな基準 (c = 0.5) を使用して刺激をサイレントに分類します。 保守的な基準の論理は、2 番目のリーダーは誤った陽性反応を減らすために使用されており、そのため、わずかである可能性のある人間の陽性反応に疑問を呈することを目的としているということです。 観察者と AI の意見が異なる場合、AI は人間の観察者に通知します。 その後、観察者には、反応を変えるか、最初の意見に従うかを選択する機会が与えられます。

    実験 1 ~ 5 と同様に、AI の d-prime は 2.2 に固定されています。 フィードバックは普及効果を高めることが知られているため、実践とテストの両方でフィードバックが提供されます。 オブザーバーは各ブロックで 20 回の練習トライアルと 200 回のテスト トライアルを完了します。 各ブロックが完了するとすぐに、オブザーバーにはパフォーマンスの概要が表示されます。 Second Reader がブロックした後、AI の有用性に関する 3 つの主観的な質問に答えることも求められます (詳細については「ファイル」を参照)。

  3. 分析。 主な質問/仮説を検証するためにどの分析を実行するかを正確に指定します。

    まず、各ブロックのヒット、真陰性、ミス、および誤警報の数を要約します。 これから、さまざまな条件下での各観測者の精度、陽性的中率、感度 (d-prime)、および基準を計算できます。 4 つの有病率レベルでのパフォーマンスの測定値を考慮すると、ROC 曲線 (pHit x pFA) と zROC 関数 (zHit x zFA) を推定できます。 zROC の傾きが 1 に等しいという仮説 (等分散 2AFC タスクの結果) をテストします。

  4. さらに分析。 二次分析はありますか?

    AI に関する観察者の主観的な意見が、経験的な d プライムや陽性的中率などの変数と相関があるかどうかを確認します。

  5. サンプルサイズ。 収集される観測値の数はどれくらいですか? サンプル サイズは何によって決まりますか? 決定を正当化する必要はありませんが、数値がどのように決定されるかを正確に理解してください。

    12人のオブザーバーをテストします。 これは、以前の実験のサンプルサイズと一致しています。

  6. 他の。 他に事前登録しておきたいことはありますか? (例: データの除外、探索目的で収集された変数、計画された異常な分析?)

該当なし

研究の種類

介入

入学 (実際)

12

段階

  • 適用できない

連絡先と場所

このセクションには、調査を実施する担当者の連絡先の詳細と、この調査が実施されている場所に関する情報が記載されています。

研究場所

    • Massachusetts
      • Boston、Massachusetts、アメリカ、02215
        • Visual Attention Lab / Brigham and Women's Hospital

参加基準

研究者は、適格基準と呼ばれる特定の説明に適合する人を探します。これらの基準のいくつかの例は、人の一般的な健康状態または以前の治療です。

適格基準

就学可能な年齢

18年歳以上 (大人、高齢者)

健康ボランティアの受け入れ

はい

説明

包含基準:

  • - オンライン登録を歓迎します

除外基準:

  • 石原色覚スクリーニング検査に合格する必要があります
  • 20/25視力(矯正あり)

研究計画

このセクションでは、研究がどのように設計され、研究が何を測定しているかなど、研究計画の詳細を提供します。

研究はどのように設計されていますか?

デザインの詳細

  • 主な目的:基礎科学
  • 割り当て:なし
  • 介入モデル:単一グループの割り当て
  • マスキング:なし(オープンラベル)

武器と介入

参加者グループ / アーム
介入・治療
実験的:実験
すべての参加者は、この実験のすべての条件でテストされます。
この実験では、いくつかの条件下で、参加者はシミュレートされた人工知能の意思決定に関する情報の存在下で意思決定を行います。
ターゲットが提示される頻度は 10% から 90% まで変化します。
他の名前:
  • 基準率

この研究は何を測定していますか?

主要な結果の測定

結果測定
メジャーの説明
時間枠
D'
時間枠:データは約1時間のセッション内で収集されます。
D'(ディープライム)は、課題におけるパフォーマンスのレベルを測定する信号検出理論の指標です。

これは、真陽性反応の割合 =(真陽性試行数)/(真陽性試行数 + 偽陰性試行数)= p(TP) を計算し、さらに偽陽性反応の割合 =(偽陽性試行数)/(偽陽性試行数 + 真陰性試行数)= p(FP) を計算することで算出されます。

これらの値は「Zスコア」(例えば、ExcelのNORMSINV関数を用いて標準正規分布の逆数を計算するなど)に変換されます。

D'はZ(TP) - Z(FP)と定義されます。

その範囲は、信号をノイズから識別できない場合の0から、約4.0までです。

上限は厳密には定義されていませんが、4は観察者が信号とノイズを本質的に完璧に識別できることを意味します。
データは約1時間のセッション内で収集されます。
基準
時間枠:データは約1時間のセッション内で収集されます。
基準(criterion)は、D'(上記参照)と同様に、z(TP)とz(FP)から計算されます。 基準(c) = (z(TP)+z(FP))/-2。 値がゼロの場合、観察者は陽性(例:「ターゲット存在」)反応と陰性(非存在)反応を同程度の確率で行うことを意味します。 正の値は、観察者が「非存在」と答える可能性が高い(「保守的」な基準)ことを意味します。 負の値は、観察者が「存在」と答える可能性が高い(「リベラル」な基準)ことを意味します。 この場合の「リベラル」と「保守的」には政治的意味合いはありません。 基準値はほぼ常に-2から2の間に収まります。
データは約1時間のセッション内で収集されます。

二次結果の測定

結果測定
メジャーの説明
時間枠
反応時間
時間枠:データは約1時間のセッション内で収集されます。
これは、応答にかかる時間の尺度です。
データは約1時間のセッション内で収集されます。

協力者と研究者

ここでは、この調査に関係する人々や組織を見つけることができます。

捜査官

  • 主任研究者:Jeremy M Wolfe, PhD、Brigham and Women's Hospital

研究記録日

これらの日付は、ClinicalTrials.gov への研究記録と要約結果の提出の進捗状況を追跡します。研究記録と報告された結果は、国立医学図書館 (NLM) によって審査され、公開 Web サイトに掲載される前に、特定の品質管理基準を満たしていることが確認されます。

主要日程の研究

研究開始 (実際)

2020年1月1日

一次修了 (実際)

2024年8月1日

研究の完了 (実際)

2025年11月4日

試験登録日

最初に提出

2022年2月18日

QC基準を満たした最初の提出物

2022年2月28日

最初の投稿 (実際)

2022年3月9日

学習記録の更新

投稿された最後の更新 (実際)

2026年1月20日

QC基準を満たした最後の更新が送信されました

2025年12月29日

最終確認日

2025年12月1日

詳しくは

本研究に関する用語

キーワード

追加の関連 MeSH 用語

その他の研究ID番号

  • 2007P000646-B
  • R01CA207490 (米国 NIH グラント/契約)

個々の参加者データ (IPD) の計画

個々の参加者データ (IPD) を共有する予定はありますか?

はい

IPD プランの説明

匿名化された生データは実験の OSF ページに掲載され、PI へのリクエストに応じて入手することもできます。

IPD 共有時間枠

資料はご要望に応じてご用意いたします

IPD 共有アクセス基準

本質的に無制限

IPD 共有サポート情報タイプ

  • STUDY_PROTOCOL
  • SAP
  • ICF

医薬品およびデバイス情報、研究文書

米国FDA規制医薬品の研究

いいえ

米国FDA規制機器製品の研究

いいえ

この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。

購読する