このページは自動翻訳されたものであり、翻訳の正確性は保証されていません。を参照してください。 英語版 ソーステキスト用。

音声の知覚と生成に対する仮想現実の影響

2023年3月7日 更新者:Katherine Verdolini、University of Delaware

大規模な研究プロジェクトの臨床試験部分の具体的な目的は、無作為化された被験者内および被験者間の混合モデルを使用して、従来の臨床環境と比較した VR 環境での音声トレーニング (共鳴音声) の有用性に関する予備データを取得することです。実験計画。

独立変数は、(1) トレーニングおよびテスト条件 (トレーニング用の診療室 vs VR 教室) です。 (2) 話し手と聞き手の視覚的な距離 (トレーニングでは 2m、4m、6m)。 (3) 時点 (2 m でのベースライン、4 m での保持テスト、転送テストの場合は 9 m)。 従属変数は、(a) 声の音圧レベル (SPL) です。 (b) スペクトル モーメント (スペクトル平均と標準偏差 (Hz とセント)、歪度、尖度)。

仮説は、トレーニング条件と時点の間に双方向の相互作用が示され、典型的な臨床環境よりも VR 環境でのトレーニング後の音声スキルの獲得と伝達が大きくなるというものです。

このシリーズでは、高度なイノベーションと洗練された VR 技術を利用して、音声療法におけるその後の VR 開発に重要なパラメーターを特定し、現在の研究に基づいて基礎科学と翻訳価値の両方を拡大するためのその後の研究の経験的基盤を築きます。

調査の概要

詳細な説明

このプロジェクトは、3 つの特定の目的に取り組んでいます。 特定の目的 1 と 2 は、特定の目的 3 で対処される臨床試験のパラメーターの多くを設定します。臨床試験を含むプロジェクト全体の詳細は、次のとおりです。助成金の提案からコピーして貼り付けます。

3.0 研究アプローチ 全体的な目的は、VR を調査ツールとして使用して、聴覚、視覚、および視聴覚情報が自分自身の声の知覚と生成に及ぼす影響を調査し、音声における VR の潜在的な有用性に関する予備データを提供することです。トレーニング環境。 特定の目的に関する詳細は、関連するページに記載されています。

3.1 参加者: SA1 と SA2 では、24 歳から 50 歳までの 60 人の声が健康な教室の教師が採用されます (3.2 を参照)。 この年齢範囲の下端は、教師が専門的な教師としてのキャリアを開始する可能性のある最も早い年齢を表し、上端は女性の閉経の平均開始年齢を表します。データへの影響。 すべての参加者は SA1 と SA2 に参加します。SA1 と SA2 は、知覚測定 (SA1) と生産測定 (SA2) の異なる分析を使用して、同じ同時データ収集手順を使用します。 探索的である SA3 では、同じ特性を持つ 10 人の健康な教師が追加で採用されます。 すべての SA の包含基準と除外基準は次のとおりです。 ; (2) 2 週間以上続く音声障害の病歴がなく、Voice Handicap Index -10 (VHI-10)63 スコア < 10; (3) 生涯非喫煙者。 (4) 聴覚または未矯正の視覚障害がないこと。書面による書類: (5) 完全な COVID-19 ワクチン接種の証明。臨床的評価による: (6) 参加日の通常の声、Consensus-Auditory Perceptual Evaluation of Voice (CAPE-V) < 10.65 除外: 自己申告による:(7) 声帯の病歴または声に影響を与える他の病状; (8) 咳、鼻づまり、または 98.6o F (37.0o C) を超える温度など、発声に影響を与える可能性のある急性状態。 音声障害に関連する複雑さを導入する前に、この段階では声が健康な教師のみが評価されることに注意してください。 これらの複雑さは、現在のシリーズに基づく後の翻訳作業で対処されます。 この研究プログラムは、最終的には声に問題のある教師だけでなく、現在健康な教師の職場環境にも関連していることに注意してください。

3.2 検出力分析: 検出力分析では、SA1 と SA2 にわたるすべての従属変数の検定について、両側で d = 0.4 の中程度の効果サイズを想定しました。 結果は、有意水準 α = 0.05 および検出力 0.8 のすべての変数の結果を検出するには、N = 51 で十分であることが示唆されました。 減少の可能性を考慮して、目的 1 と 2 のために 60 人の参加者が募集されます。この数は、共同研究者のボッタリコと私たち自身のより最近の予備データによって、現在のシリーズで調査されたものと同様の重要な効果を検出するのに十分であることが示されています。 (例えば、発声努力と快適さの知覚的評価、および SPL と平均 f0 の違い; (Bottalico、2017; Bottalico et al.、2016; Daşdöğen et al.、未発表データ)。 探索的であるSA3の場合、合計10人の参加者が募集され、後の臨床シリーズの予備データを取得します。

3.3 手順 3.3.1 SA1 および SA2: 60 人の K-12 クラスの教師が、コミュニティやソーシャル メディアに投稿されたチラシ、およびデラウェア、ニュージャージー、ペンシルバニア、およびメリーランドの公立学校との直接の連絡を通じて募集されます。デラウェア大学の研究サイトに近接していること。 参加に関心を持って PI に連絡した個人は、電話または安全なリモート接続で研究の概要を受け取り、同意する場合はインフォームド コンセントを提供します。 同意後、参加者は、HIPAA 準拠のサーバーを使用してオンライン スクリーニング REDCap アンケートに誘導され、声の臨床聴覚知覚評価 (CAPE-V) を除くすべての包含および除外基準に対処します。 資格のある参加者は、デラウェア大学 STAR キャンパスのボイス ラボでラボ内の予定が立てられます。 予定の開始時に、臨床医は CAPE-V を使用して参加者の声を評価し、通常の声質であることを確認します。 この最終審査段階に合格した参加者 (全体的な CAPE-V 重症度スコア < 10) は、実験手順に進みます。 その他は免責となります。

実験手順では、最初に、参加者は研究中に使用されるスピーチ タスクのトレーニングを受けます。教室で 15 秒間自己紹介し、教育の専門知識に関連する 2 分間のチュートリアルを提供し、母音 /a/ を維持します。 3 秒が 3 回繰り返され、CAPE-V のフレーズ「1 年前は離れていました」が 3 回繰り返されました。 参加者は、自己認識された声の大きさ、声の努力、および音声刺激に対する声の快適さをセットとして反映する自己報告アンケートの指示を受け取ります (6.0 を参照)。 これらの指示の配信に続いて、ヘッドセット マイク、ヘッドフォン、VR メガネを含む機器が配置されます (4.0 を参照)。 参加者は、ランダムに並べられた 15 の条件のそれぞれで、バックグラウンド ノイズの有無にかかわらず、実験的なスピーキング タスクを実行します。これは、現実世界の部屋の聴覚的および視覚的特性を事実上模倣します。これは、小規模から大規模な講堂までさまざまで、音響特性がドライから非常に反響が大きく、さまざまなスピーカーがあります。リスナー間の距離。

室内音響は、VR 環境全体で音響的に変化する条件を特徴付け、制御するために規定されます (ISO 3382、5.0 を参照)。 OBRIR 測定値は、イリノイ大学アーバナ シャンペーン校のキャンパスの教室、講堂、および学校の​​講堂環境で取得されます。この環境では、寸法は VR 教室の寸法と同様です (5.0 を参照)。 Ovation ソフトウェア (Ovation VRSpeaking, LLC, NJ, US) は、リアルな VR ルームと 3D リスナーを提供するために使用されます (4.0 を参照)。 実験タスクには、トレーニング条件に関して、(i) 外部のオーディオまたはビジュアル フィードバックまたはバックグラウンド ノイズがない (実験ベースライン)、(ii) 各聴覚条件のみで、(iii) 各視覚条件で、プロンプト発話の文字列が含まれます。単独で、および(iv)聴覚および視覚状態の各組み合わせで。 すべての条件 ii ~ iv は、簡単に説明するバックグラウンド ノイズの有無にかかわらず生成されます。 音声のみの条件では、参加者は視覚情報を遮断するためにアイマスクを着用します。 そのような状況では、コミュニケーションの意図を支援するために、参加者は、各スピーチストリングを開始する前に、一致した部屋の音響応答と畳み込まれた拍手を聞きます。遠く離れたリスナーは環境内にいます。 参加者の環境への関与を強化するために、話す前に、試験官は参加者に聴衆の規模と話者間の距離を推定するよう求めます。 すべての視覚的条件について、参加者はそれぞれの視覚的な部屋と、スピーカーに現実的な方法で反応する着席リスナーを確認します (例: 座ったまま移動する、頭を掻くなど)。 参加者の関与をさらに促進するために、試験官は各参加者に、環境内に何人いるのか、どのくらい離れているのかを尋ねます。 どのような場合でも、参加者は「全員が理解できるように話す」よう求められます。 前述のように、すべての条件は、参加者のスピーチ中に配信されるバックグラウンド ノイズの有無にかかわらず実行されます。 騒音レベルは、典型的な教室環境を表すレベルに相当します (平均 54 dB)66。 参加者が各条件で音声発話を行った後、VR ゴーグルまたはアイマスクを外し、前の発話のラウドネス、発声努力、および発声の快適さについての自己申告に関するアンケートに回答するよう求められます。 アンケートは、VAS スケールでのデジタル回答を可能にするコンピューター画面に表示されます (6.0 を参照)。 その後、参加者は次の VR 条件に進み、すべての条件のデータ収集が完了するまでセッションを終了します。 セッションの合計所要時間は約 120 分を予定しています。

3.3.2 SA3: 参加者は 10 人の教室の教師になります。 声の臨床聴覚評価を除いて、包含基準と除外基準を満たした後、適格な参加者は、SA1 および SA2 と同様に音声評価のために STAR 音声ラボに提出します。 音声スクリーニングに合格した参加者には、関連する機器が装着されます (3.3.1; 4.0) であり、SA1 および SA2 と同じ発話文字列を生成します。話者とターゲットの距離は 4 m で、物理的なマネキンによって指定されます。 次に、参加者は、従来の臨床室または VR 環境の 2 つのトレーニング条件のいずれかにランダムに割り当てられます。 それぞれの条件で、参加者は、健康な話者にも価値のある「共鳴する声」という治療的な発声パターンでトレーニングを受けます.68-71 トレーニングは、音声障害で少なくとも 2 年の経験があり、Lessac-Madsen Resonant Voice Therapy (LMRVT) の標準化されたトレーニングを完了した言語病理学者によって提供されます。 両方の環境でのトレーニングを通じて、バックグラウンド ノイズは、SA1 と SA2 のように、従来の環境では自由音場で、VR 環境ではヘッドフォンで提示されます。 どちらのトレーニング条件でも、LMRVT のセッション 2 の教材が使用されます。これは、そのプログラムで実際の音声トレーニングが開始される最初のセッションです。 従来の診療室の状態では、セッション 2 の教材を使用した 30 分間の LMRVT トレーニングの後、参加者はセッション 2 から順番に同じエクササイズを繰り返すようにガイドされ、2 メートルの位置にいる人に話しかけるように声を出すように指示されます。物理的なマネキンによって表されるスピーカーから 5 分間。 その後、参加者は、4 メートルの位置にあるマネキンに 5 分間、最後に 6 メートルの位置に 5 分間話しかけるように、同じエクササイズを繰り返します。 これらの各距離でのトレーニングに続いて、参加者は音声データ収集のために記録されるベースライン発話を繰り返します。 VR 環境条件の場合、参加者は従来の部屋と同じ LMRVT トレーニングを受けますが、SA1 と SA2 用に作成されたが結果に依存しない実際の教室条件の代表として VR 教室 (部屋 1; 表 1) でのみ行われます。それらの目的のために。 参加者は LMRVT セッション 2 の演習で 30 分間トレーニングを受け、その後、セッション 2 と同じ演習を繰り返し、VR 環境でリスナーに向けて適切な発話を生成するように指示されます。各距離で5分間スピーカー。 従来の環境と同様に、音声録音は、各距離でのトレーニングに続くベースライン発話を使用して行われます。 すべてのトレーニングが完了した後、両方の条件の参加者は、STAR 設定の標準教室 (部屋 513、容積/フロア プラン ~2440 m3/69 m2) に案内されます。 その設定では、参加者は保持テストと新しい距離 (9 メートル) のために 4 メートルに配置されたライブの着席リスナーに話すベースライン スピーチ タスクを繰り返すように求められ、録音は以前のように行われます。 その後、参加者は免除されます。 合計所要時間は約 90 分です。 約 30 分程度の短い訓練セッションは、主任研究者の豊富な臨床経験と一致して、発声に変化をもたらすことが示されている 94。 したがって、現在のシリーズでそのような変化が見られると予想されます。これにより、現在の研究から成長する計画されたR01に適した、より拡張された縦断的研究の基礎が準備されます。

4.0 機器: デジタル オーディオ ワークステーション (Reaper バージョン 6.36、米国ニューヨーク州ローゼンデール) とヘッドマウント マイクロフォン (AKG C 520、Harman) を使用して、すべての SA の音声信号をキャプチャします。 オーディオ録音は 44.1 kHz でサンプリングされます。 マイクと口の距離は 5cm で、マイクは参加者の口から 450 の角度に配置されます.72 マイクはオーディオ インターフェイス (Babyface Pro FS 24 チャンネル USB 2.0、ドイツ、ハイムハウゼン) に接続され、合計入力/出力遅延は 5 ミリ秒未満になります。これは、顕著なエコーの範囲 (16および 26 ミリ秒)73 インターフェイスは、オーディオ レンダリングを作成するために Reaper オーディオ ワークステーションを実行しているコンピューターに接続されます。 バーチャル リアリティ グラス (Oculus Rift S) を使用して、視覚情報 (部屋と 3D アバター リスナー) を生成します。 ルーム ボリュームの画像とリスナーは、Ovation ソフトウェア (https://www.ovationvr.com/) を使用して提供されます。 このソフトウェアを使用すると、現実世界の例を再現する複数の教室環境を選択し、デジタルで生成された何百もの 3D 聴衆 (実在の人物) に話しかけることができます。聴衆は、笑顔、拍手、または移動によってスピーカーに応答します。 最近の研究では、現実世界のビジュアル シナリオを作成するためのこのソフトウェアの有効性が報告されています.92 オーディオ マイクは、公開されている手順に従って校正されます。 VR メガネは、参加者ごとに最適な位置に配置されます。 すべての発話は暗号化されたフォルダーに wav ファイルとして保存されます。

5.0 室内音響測定とオーディオ レンダリング: Ovation ソフトウェアで選択されたものと同様のサイズの部屋 (教室、講堂、学校の講堂) が、イリノイ大学アーバナ シャンペーン校のキャンパス内で選択されます (Co-I による)。ボッタリコ)。 部屋は、ISO 3382 に従って音響的に特徴付けられます。

部屋のスピーカーが通常配置されている位置で、HATS を使用してオーラルバイノーラル インパルス応答が測定されます。 具体的には、オーラルバイノーラル インパルス応答 (OBRIR) は、公開されている方法に従って畳み込み法を使用して取得されます。 具体的には、頭と胴体のシミュレーター (HATS、GRAS 45BB KEMAR) の口から発せられる指数掃引信号が、HATS の耳によって記録されます。 記録されたスイープ (HATS の耳で) と放出されたスイープの逆 (HATS の口で) の間の畳み込みにより、OBRIR が生成されます。 OBRIR は、スピーカーの耳から口へのパスを考慮して、部屋を音響的に再現するために使用されます。

仮想室内音響における被験者の声のリアルタイム オーディオ レンダリングは、ソルボンヌ大学のコンサルタント Katz によって開発された Analglyph や RoomZ などのリアルタイム畳み込みプラグインを使用して実現されます.74 畳み込みエンジンは、測定された部屋のインパルス応答を採用します。 仮想音響レンダリングは、オープンバック ヘッドフォン (HD 660S、Sennheiser、Wedemark、ドイツ) を介して参加者に再生され、自分の声を聞くことによる着色を制限します。

6.0 測定値: SA1 の場合、ビジュアル アナログ スケール (VAS; 表 2) を使用して、声の大きさ、声の努力、および声の快適さに関する 3 つの個別の質問から、自己報告の知覚測定値が導き出されます。 各研究条件の後、VR メガネが取り外され、参加者は HIPAA 準拠の REDCap を使用して VAS を完了します。 REDCap 認識アンケートは、コンピューター画面に表示されます。 参加者は、スケール上のスライダーを 0 (まったくない) から 100 (非常に[まったく]) まで動かして、各知覚の質問に順番に回答します。 各応答は、REDCap データベースに数値として記録されます。 アンケートの完了には約 2 分かかります。これは、前の研究条件の後に休憩を提供し、声の疲労の可能性を最小限に抑えるのに役立ちます。 SA2 と SA3 の場合、楽器を使用した声の測定には、声の音圧レベル SPL とスペクトルモーメントが含まれます (7.0 を参照)。

7.0 データの抽出と分析: 音声パラメーターの抽出は、Matlab R2021b (MathWorks、Natick、MA、米国) および Praat (バージョン 6.2.14) を使用して実行されます。 録音ごとに、SPL90 と基本周波数 f0 の時間履歴が 0.05 秒のタイム ステップで取得されます。 f0 は、正確な自己相関法に基づく音響周期性検出アルゴリズムで推定されます。 この方法は、ケプストラムやコームに基づく他の方法、または元の自己相関方法よりも正確で、ノイズに強く、堅牢です。 2 つの時間履歴について、統計モーメントが計算されます (スペクトル平均、標準偏差、歪度、および尖度)。 さまざまな程度の発声努力を区別するスペクトルモーメントの能力は、以前に報告されています.76 これらの措置は、声の努力と快適さに関連して、声の質の潜在的な変化に関連する可能性のある主要なスペクトルの寄与を定量的に評価します。 ただし、このシリーズでは音声品質の知覚測定は行われません。

8.0 統計分析: すべての SA について、線形混合効果 (LME) モデル (Matlab R2021b) が制限付き最尤法 (REML) によって適合されます。 これらのモデルの従属変数と独立変数は、SA セクションにリストされています。 参加者 ID はランダム効果項として使用されます。 ここで、「参加者 ID」のランダム効果とは、各参加者 ID の傾きと切片がランダムである「参加 ID」による観測の部分的なプーリングを指します。 モデルは、赤池情報量基準と尤度比検定の結果に基づいて選択されます。 Tukey のポストホック ペアワイズ比較は、対象の固定因子が 2 レベルを超える場合 (この場合はオーディオ環境とビジュアル環境の両方) のすべてのレベル間の違いを調べるために実行されます。 これらはペアワイズ z 検定であり、z 統計量は、観測された統計量とその仮説母集団パラメーターとの差を標準偏差の単位で表します。 これらの検定の p 値は、デフォルトのシングル ステップ法を使用して調整されます。 LME 出力には、固定効果係数の推定値、推定値に関連付けられた標準誤差、自由度 (df)、検定統計量 (t)、および p 値が含まれます。 Satterthwaite 法を使用して、自由度を概算し、p 値を計算します。

研究の種類

介入

入学 (予想される)

10

段階

  • 適用できない

連絡先と場所

このセクションには、調査を実施する担当者の連絡先の詳細と、この調査が実施されている場所に関する情報が記載されています。

研究連絡先

  • 名前:Katherine Verdolini Abbott, PhD
  • 電話番号:302-831-0956
  • メール:kittie@udel.edu

研究連絡先のバックアップ

  • 名前:Umit Dasdogen, PhD
  • 電話番号:302-831-0956
  • メール:umitudas@udel.edu

参加基準

研究者は、適格基準と呼ばれる特定の説明に適合する人を探します。これらの基準のいくつかの例は、人の一般的な健康状態または以前の治療です。

適格基準

就学可能な年齢

24年~50年 (大人)

健康ボランティアの受け入れ

はい

受講資格のある性別

女性

説明

包含基準:

自己申告による: (1) 24 歳から 50 歳までの、少なくとも 2 年間の教育経験を持つ K-12 教室の教師 (SA1 および SA2) または小学校の教室の教師 (SA3)。 (2) 2 週間以上続く音声障害の病歴がなく、Voice Handicap Index -10 (VHI-10)63 スコア < 10; (3) 生涯非喫煙者。 (4) 聴覚または未矯正の視覚障害がないこと。書面による書類: (5) 完全な COVID-19 ワクチン接種の証明。臨床評価による: (6) 音声のコンセンサス聴覚知覚評価 (CAPE-V) < 10.65 からの全体的な重症度スコアに基づいて、音声専門のライセンスを受けた SLP によって評価された、参加日の通常の音声。

除外基準:

自己申告による: (7) 声帯の病理または声に影響を与えるその他の病理の病歴。 (8) 咳、鼻づまり、または 98.6o F (37.0o C) を超える温度など、発声に影響を与える可能性のある急性状態。 音声障害に関連する複雑さを導入する前に、この段階では声が健康な教師のみが評価されることに注意してください。 これらの複雑さは、現在のシリーズに基づく後の翻訳作業で対処されます。 この研究プログラムは、最終的には声に問題のある教師だけでなく、現在健康な教師の職場環境にも関連していることに注意してください。

-

研究計画

このセクションでは、研究がどのように設計され、研究が何を測定しているかなど、研究計画の詳細を提供します。

研究はどのように設計されていますか?

デザインの詳細

  • 主な目的:基礎科学
  • 割り当て:ランダム化
  • 介入モデル:順次割り当て
  • マスキング:なし(オープンラベル)

武器と介入

参加者グループ / アーム
介入・治療
実験的:従来の介入
参加者は、標準的な臨床環境で、従来の音声トレーニングを受けます。
従来の現実と仮想現実
他の名前:
  • バーチャル リアリティ音声トレーニング
実験的:仮想現実介入
参加者はバーチャル リアリティ環境下で音声トレーニングを受けます。
従来の現実と仮想現実
他の名前:
  • バーチャル リアリティ音声トレーニング

この研究は何を測定していますか?

主要な結果の測定

結果測定
メジャーの説明
時間枠
自己申告ラウドネス
時間枠:2週間
自己申告ラウドネス
2週間
音圧レベル
時間枠:2週間
音圧レベル
2週間

二次結果の測定

結果測定
メジャーの説明
時間枠
自己申告による声の努力と快適さ
時間枠:2週間
自己申告による声の努力と快適さ
2週間
スペクトルの瞬間
時間枠:2週間
スペクトル平均、標準偏差、歪度、尖度
2週間

協力者と研究者

ここでは、この調査に関係する人々や組織を見つけることができます。

研究記録日

これらの日付は、ClinicalTrials.gov への研究記録と要約結果の提出の進捗状況を追跡します。研究記録と報告された結果は、国立医学図書館 (NLM) によって審査され、公開 Web サイトに掲載される前に、特定の品質管理基準を満たしていることが確認されます。

主要日程の研究

研究開始 (予想される)

2024年4月1日

一次修了 (予想される)

2024年8月31日

研究の完了 (予想される)

2025年3月31日

試験登録日

最初に提出

2023年3月7日

QC基準を満たした最初の提出物

2023年3月7日

最初の投稿 (実際)

2023年3月17日

学習記録の更新

投稿された最後の更新 (実際)

2023年3月17日

QC基準を満たした最後の更新が送信されました

2023年3月7日

最終確認日

2023年3月1日

詳しくは

本研究に関する用語

個々の参加者データ (IPD) の計画

個々の参加者データ (IPD) を共有する予定はありますか?

未定

IPD プランの説明

データは、査読済みの出版物やプレゼンテーションで共有されます。

医薬品およびデバイス情報、研究文書

米国FDA規制医薬品の研究

いいえ

米国FDA規制機器製品の研究

いいえ

この情報は、Web サイト clinicaltrials.gov から変更なしで直接取得したものです。研究の詳細を変更、削除、または更新するリクエストがある場合は、register@clinicaltrials.gov。 までご連絡ください。 clinicaltrials.gov に変更が加えられるとすぐに、ウェブサイトでも自動的に更新されます。

購読する