目次
スマートフォンで動画を撮るとき、被写体にズームインすると映像は拡大されるのに、音は遠くに置き去りにされたままです。
話し声が近づいて聞こえてくることはありません。
音響ズームと呼ばれるこの機能を民生用カメラに載せる試みは、計算量とハードウェア費用の壁に阻まれてきました。
複数のマイク信号を線形結合するだけで、この壁を越えられるのでしょうか。
こんにちは。
音楽家の朝比奈幸太郎です。
よかったらまずは、Kuonに無料登録してみませんか?
音楽家に必要な機能がすべてブラウザで統合されていて、難しいインストールやPCの知識はもう不要になり、あなたの創造性、そして音楽制作や練習だけに専念できるようになります!
なぜ民生用カメラに音響ズームは搭載されてこなかったのか
音響ズームとは、あたかも正面の音源に近づいたり遠ざかったりしているように聴かせる機能です(Van Waterschoot ら, 2013)。
カメラの光学ズームに相当する聴覚的な操作で、映像と音のあいだの感覚的なつじつまを合わせる役割を担います。
人間は、直接音と残響音のエネルギーの比である直接音対残響音比(DRR)を、音源までの距離を知る手がかりの一つとして使っています。
音響ズームの実現には、このDRRを含む複数の聴覚手がかりを操作する必要があります。
それまでに提案されていた音響ズームの方式には、大きく二つの系統がありました。
一つはアイゲンビームフォーミングで、球状のマイクアレイを使って音場を球面調和関数に分解する手法です。
空間的な解像度は高いものの、特殊な形状のアレイを必要とし、民生機器に載せるには高価です。
もう一つは指向性音響符号化(DirAC)で、信号を時間周波数領域で単一チャンネルのストリームと到来方向および拡散度の補助情報に分解する方式です。
計算負荷が大きく、これも民生用には適しません。
つまり、民生用カメラに音響ズームを載せるには、低コストのハードウェアで動作し、なおかつ計算の手間が少ない方式が求められていたのです。
この課題に対してマイクアレイの設計と信号処理の両面から取り組んだ研究は、マイクアレイの設計と定位予測をブラウザで行うには、その研究を読むでも触れられています。
どうすれば少ないマイクで複数の音源レベルを独立に制御できるのか
Van Waterschoot ら(2013)の提案は、音源分離を経由しないという点で、それまでの方式と一線を画します。
通常、音響ズームを実現するには、まずどの音がどの方向から来ているかを特定し、それぞれを分離してからレベルを操作するという手順が想定されます。
ところがこのアプローチには、マイクの数が音源の数を上回らなければならないという制約があります。
著者らはこの制約を回避するために、線形結合という考え方を導入しました。
具体的には、収録環境に四つの成分が存在すると仮定します。
正面方向の目的音源、背面方向の音源、それ以外の特定方向に局在する妨害音源、そして拡散騒音場です。
拡散騒音場とは、単一の方向や音源に帰属させられない、空間的に一様な不要音の成分を指します。
すべての音源は遠距離場にあり、仰角はゼロと仮定されています。
この単純化によって、後段の演算をスカラー演算に抑える道が開かれます。
このモデルのもとで、三つの補助信号を生成します。
補助信号は、基準マイクの信号に対して各音源成分の重みを変えたものです。
音響ズームの出力は、基準信号と三つの補助信号の線形結合として計算されます。
著者らがこの方式を選んだ理由は、まさにここにあります。
スカラー演算であれば計算量は抑えられ、携帯電話に載っているような低コストのマイクとプロセッサでも十分に動作するからです。
処理の構造は三段階に分かれています。
第一段は固定ビームフォーマで、超指向性ビームフォーマと正面キャンセルビームフォーマ(FCB)の二つからなります。
超指向性ビームフォーマとは、拡散騒音場のもとでアレイ利得を最大化するように設計された固定ビームフォーマです。
正面キャンセルビームフォーマは、正面方向に零点を持ち、それ以外の方向には応答するビームフォーマで、雑音の参照信号を作るために使われます。
この二つを組み合わせた構造がブロッキング行列と呼ばれる部分です。
ブロッキング行列の役割は、目的音源成分を打ち消したうえで雑音の参照信号を取り出すことです。
この構造は一般化サイドローブキャンセラ(GSC)の枠組みに沿ったものです。
第二段は適応ビームフォーマで、音声歪み重み付き多チャンネルウィナーフィルタ(SDW-MWF)が使われます。
SDW-MWFとは、不要成分のエネルギーと目的成分の歪みの両方を同時に最小化する適応フィルタです。
雑音を抑えつつ、目的の音をできるだけ変形させないという、二つの要求をバランスさせる役割を担います。
第三段は適応スペクトル減衰段で、周波数領域での減衰処理を加えて出力を整えます。
評価は、携帯電話に搭載された三つの低コストマイクで収録されたマルチマイクロフォン録音を使ったシミュレーションで行われました。
現実的な音響環境で収録されたデータを用いることで、机上の理論にとどまらない検証がなされています。
複数マイクによる収録技法の比較については、マルチチャンネルマイクアレイは定位感と包み込みでどう違うのか、その研究を読むも参照してください。
提案方式は実際の収録環境でどう機能するのか
実験の結果、この提案方式は民生用のオーディオビジュアル収録に適していることが確認されました(Van Waterschoot ら, 2013)。
携帯電話に搭載された三つの低コストマイクという、きわめて限られたハードウェア資源のなかでも、音響ズームの基本動作がシミュレーション上で成立したことになります。
この結果はどこまで適用できるのか
著者らは、この研究の限界を明示的には挙げていません。
そこで、この研究が設定した条件から自然に読み取れる適用範囲を整理します。
第一に、この研究で扱われた音場モデルでは、すべての音源が遠距離場にあり、仰角がゼロであると仮定されています。
そのため、上下方向を含む三次元の空間や、音源が近距離にある場合は、このモデルの適用範囲外です。
著者自身も、三次元への拡張は可能だが本論文では扱っていないと述べています。
第二に、音響ズーム効果を実現するための時変ゲイン係数は、詳細な仕様が示されておらず、別の文献に委ねられています。
ズームの効き具合を決める要素ですが、この論文の範囲内では明示されていません。
第三に、補助信号の重み係数の計算について、著者らはオフラインのヒューリスティック手法を推奨しており、撮影中のリアルタイム処理は扱っていません。
撮影しながら逐次的に音響ズームを制御するオンライン処理は未解決です。
第四に、評価はシミュレーションで行われており、実際の製品への組み込みや、ユーザーを対象とした聴感評価は含まれていません。
この研究をどう位置づけるか
この研究は、音響ズームという機能を民生機器へ近づけるための、アルゴリズム面の提案として位置づけられます。
それまでの方式が特殊なハードウェアや高い計算能力を前提としていたのに対し、線形結合という単純な演算で同様の効果を目指した点に、このアプローチの特徴があります。
とくに、音源分離を明示的に行わないことで、マイク数が音源数を上回るという制約を回避したことは、三つという限られたマイク数で動作させるうえで実用的な意義があります。
一方で、この論文が示したのは方式の基本的な枠組みと、シミュレーションによる初期的な確認です。
時変ゲインの設計指針やオンライン処理、三次元空間への拡張といった課題は、著者ら自身が今後の課題として残したままでした。
この論文は、これらの課題に取り組むための出発点となる枠組みを提供したものと受け止めるのが妥当です。
参考資料
Acoustic Zooming by Multimicrophone Sound Scene Manipulation, Toon van Waterschoot, Wouter Joos Tirry, Marc Moonen, J. Audio Eng. Soc., Vol. 61, No. 7/8, 2013 July/August.
原典の主張は、Acoustic Zooming by Multimicrophone Sound Scene Manipulation をご参照ください。

