目次
ヘッドホンで仮想の音を聴くとき、その音が今いる部屋に自然に溶け込むためには、部屋自身の響きを知らなければなりません。
ところが、測定用の音を流さず、すでに鳴っている音だけを聴いて、部屋の広さと残響の長さを知ることはできるのでしょうか。
この記事は、その問いに取り組んだ Murgai ら(2017年)の研究を読み解きます。
Kuonではこれらの研究資料を参考にしたアプリを多数開発しています。
音楽家に必要なすべてのツールを統合したプラットフォーム、ぜひ一度利用してみてください。
録音だけで部屋の響きを知るには、何が足りなかったのか
拡張現実(AR)では、ユーザーがいる実空間と、仮想音源が置かれた空間の音響特性が異なる場合があります。
ヘッドホンで3Dオーディオを自然に再生するには、実環境の残響特性を知っておく必要があります。
ここで研究が手がかりにするのが、残響フィンガープリントという考え方です。
残響フィンガープリントとは、部屋の容積と、周波数依存の拡散残響減衰時間の組み合わせで、部屋の音響的特徴を表すものです。
この二つの量が分かれば、その部屋がどう響くかを特徴づけられます。
では、どうやって得るのか。
残響時間を測る古典的な方法は、部屋にテスト信号を流し、その減衰を観測することです。
たとえば、部屋の残響時間をポータブル装置でその場で測ることは可能か、その研究を読むや、32個の小型スピーカーで作る球形音源は部屋の音響測定に使えるのか、その研究を読むのように、測定用の音源や装置を使うやり方があります。
ところがARの利用中にテスト信号を流すのは実用的ではありません。
そこで提案されたのがブラインド推定です。
ブラインド推定とは、音源の参照信号にアクセスせず、単一マイクロホンが拾った残響信号の録音だけから、部屋の残響特性を推定することです。
ただし、録音全体をそのまま部屋の特徴として使うことはできません。
典型的な閉空間では、残響時間は音源や受音位置に依存しない部屋固有の性質とみなせますが、残響パワーやスペクトルは音源と受音器の影響を受けます。
そこで研究が注目するのが、拡散音場残響パワーです。
拡散音場残響パワーとは、残響の拡散した部分のパワーのことで、同じ減衰時間と音源・受音者であれば、部屋の容積に反比例すると仮定される量です。
この部分に限定することで、部屋そのものを特徴づけようというわけです。
録音から残響時間と容積を、どうやって取り出すのか
方法は二つの柱からなります。
残響時間の推定と、容積の予測です。
まず残響時間の推定です。
音声の休止中、録音には部屋の残響の減衰が現れます。
この減衰の速さから残響時間を読み取ります。
手順はこうです。
最初に、忘却係数 α=0.2 のランニングエネルギー推定器と、時定数 τ=5 ms のリーキー積分器ベースRMS検出器を使って、信号のエネルギー包絡を求めます。
エネルギー包絡とは、信号のエネルギーが時間とともにどう変化するかを近似した曲線のことです。
次に、エネルギー包絡から局所ピークを検出し、最大ピークに依存する閾値と、50 ms 以上の単調減少という条件を満たす区間を、減衰区間として切り出します。
各減衰区間を dB スケールで直線フィッティングし、-60 dB の減衰に相当する時間を求めて減衰時間とします。
検出された減衰時間の集合から最小値を残響時間の候補にします。
この最小減衰時間が許容範囲 ε=0.1 の以内に η=5 回以上再帰したとき、その平均を最終的な残響時間の推定とします。
なぜ最小値なのか。
部屋の残響減衰速度は、音声休止中に観測されるエネルギー包絡の減衰速度の上限を決めます。
つまり、減衰区間のなかで最も速い減衰こそが部屋の残響時間を表す、という仮定に基づいています。
この推定を、Open AIR Library のインパルス応答を無響音声と畳み込み、オクターブ帯域(1オクターブ幅の周波数帯域)ごとにフィルタした音源について、複数の音響空間で実際の残響時間と比較し、収束を評価しました。
周波数帯域ごとに測る残響時間(帯域別残響時間)は、減衰区間の最速減衰率から推定されます。
次に容積の予測です。
まずRMSレベル検出器で音声の停止(一定時間、閾値を超えるレベル増加が検出されない時点)を検出します。
音声が止まったあとに続く信号を、室内インパルス応答の近似として使います。
室内インパルス応答とは、部屋が音に対してどう応答するかという特性そのもののことです。
この近似から特徴量を抽出します。
特徴量は、20 Hz から 20 kHz までのオクターブ帯域における T60・C80・C50、最初の 100 ms の初期反射密度と時間領域尖度、低域 20% の室内モード密度と周波数領域尖度です。
なぜこれらの特徴量なのか。
選ばれた音響特徴量の定義が、いずれも部屋の容積に関係するからだと著者らは説明しています。
学習には、画像音源法(室内インパルス応答を合成する手法)で合成した154室のインパルス応答と、12本の15秒の無響音声を使いました。
テスト用に、同じ容積範囲で異なる容積の51室を生成します。
音声停止から特徴量を抽出して容積を予測し、予測の移動平均をとって信頼性を高めます。
学習には、ガウス過程回帰(点どうしの類似度から未知の点の値を予測する教師あり学習手法)のモデルを使いました。
音声録音から、残響時間と容積はどれだけ言い当てられたのか
結果を整理します。
まず残響時間の推定です。
とくに残響時間の長い部屋では、収束の速さと精度の両面で有望な初期結果を示しました。
数秒の音声活動で、実際の残響時間に近い推定へ収束することが実現可能と思われる、と著者らは暫定的に述べています。
一方で、残響時間の短い部屋では過小評価の偏りを避ける改善が必要で、低周波数での精度向上も必要だと示唆されました。
容積の推定は、音声録音だけに基づく場合は難しい課題です。
機械学習のアプローチは、10 秒の音声活動のあと、実際の容積の 25% 以内(残響パワーに換算するとおよそ 1 dB の誤差)に収束できる可能性を、暫定的に示しました。
容積予測の時間発展の例では、容積 200 m^3 と 400 m^3 の部屋で、3.5 分の残響音声録音から 56 回の予測が得られました。
この手法は、どこまで当てにしてよいのか
著者ら自身が限界を明示しています。
まず残響時間の推定では、残響時間の短い部屋で過小評価の偏りを避ける改善が必要で、低周波数での精度向上も必要だと述べています。
容積の推定については、音声録音だけに基づく容積推定は難しい課題であり、典型的な屋内環境でこの目標が達成できるかを確かめるには、さらなる実験が必要だとしています。
この点は本論文では検証されていません。
方法上の前提も二つあります。
一つは、音声信号はインパルスに似ていないため、音声停止後の信号は室内インパルス応答の代用であって、その特性への部分的な手がかりを与えるにとどまるという点です。
もう一つは、60 dB の減衰は通常は観測できないため、検出された減衰から近似の減衰時間を求めているという点です。
この研究は、音響の推定という分野のどこに立つのか
部屋の音響的な性質、とくに残響時間は、従来はテスト信号を流してその減衰を測るという能動的な方法で得られてきました。
この研究が立っているのは、その延長線上で、音源が未知のまま録音だけから同じ情報を引き出そうとする方向です。
背景には、ヘッドホンによる3Dオーディオ再生や拡張現実のように、測定用の信号を流す余裕のない状況が現実に増えてきたという事情があります。
研究の土台には、典型的な閉空間では残響時間は音源や受音位置に依存しない部屋固有の性質とみなせる一方、残響パワーやスペクトルは音源と受音器の影響を受ける、という広く共有された理解があります。
この研究は、その理解に従って拡散残響の部分に注目し、普通の音声から残響時間と容積を取り出す具体的な手順を組み立てたところに位置づけられます。
どこまで言えるかの線引きを著者自身がはっきり示している点も、この手の研究を受け止めるうえでの土台になります。
参考資料
Blind Estimation of the Reverberation Fingerprint of Unknown Acoustic Environments
Prateek Murgai、Mark Rau、Jean-Marc Jot
2017年
Audio Engineering Society Convention Paper 9905(第143回大会、2017年10月18日から21日、米国ニューヨークで発表)
原典の主張は、Blind Estimation of the Reverberation Fingerprint of Unknown Acoustic Environments をご参照ください。

