目次
録音の現場では、マイクの指向性は収録時に決まります。
あとから指向性を変えたい、音源に合わせて向きを変えたいと思ってもできません。
32個のカプセルを球面に並べ、信号処理で仮想的な指向性を作り出せるとしたら。
Farinaら(2010)はこの課題に取り組みました。
録音したあとで指向性を変えることは、なぜ難しかったのか
放送や映画の収録では、目的外の音を抑え、狙った音源だけを捉える高い指向性が求められます。
生中継では、音源の動きに合わせて指向性を動的に変えられることも重要です。
しかし指向性は通常、マイクの物理構造によって決まり、収録後に変更する手段はありませんでした。
この問題に対し、複数のカプセルを並べたアレイで音を捉え、信号処理で指向性を合成する研究が進められてきました。
高次アンビソニックス(HOA)は音場を球面調和関数で分解して捉える方式で、波動場合成(WFS)はホイヘンスの原理に基づきスピーカアレイで音場を再現する技術です。
しかし、いずれも柔軟性や周波数帯域に制約があり、放送や映像制作の現場が求める高い指向性と低い軸外着色の両立は容易ではありませんでした。
3Dアンビエンス録音にはどのマイクアレイが適しているのか、その研究を読むでも、マイクアレイの選択が収音の質を左右することが示されています。
Farinaらが提案したのは、これらの空間カーネルを一切経由しない直接的な手法です。
ここで中心となるのが仮想マイクとFIRフィルタの概念です。
仮想マイクとは、アレイの全カプセル信号をフィルタ処理して合成した信号のことで、あたかも特定の指向性を持つマイクがそこにあるかのように振る舞います。
物理的には存在しない指向性パターンを、ソフトウェアの上で作り出せるという考え方です。
FIRフィルタ(有限インパルス応答フィルタ)は、その合成に使われるデジタルフィルタです。
各カプセルの信号に畳み込まれ、それらの総和が仮想マイクの出力となります。
このフィルタの係数を適切に設計できれば、任意の指向性を合成できる理屈になります。
32個のカプセルから、どうやって目的の指向性を計算したのか
この研究の核心は、測定から実時間処理までの一貫した手法にあります。
三つの段階に分けて説明します。
まず、インパルス応答の測定です。
半径42 mmの球面アレイ(Eigenmike)に配置された32個のカプセルすべてについて、無響室でインパルス応答を測定しました。
測定信号には指数掃引正弦波(ESS)を使いました。
ESSとは、周波数が指数関数的に上昇する掃引信号で、非線形歪みを分離して高い信号対雑音比を得られる測定手法です。
音源をタンテーブルで回転させ、36段階の方位角と18段階の仰角、合計648方向から各カプセルの応答を記録しました。
各インパルス応答の長さは2048サンプルです。
測定後、タンテーブルの偏心による距離のばらつき(最大30 mm)を補正し、2 mmの精度まで時間軸を揃えました。
次に、フィルタ行列の計算です。
得られた全方向のインパルス応答行列を、周波数領域で最小二乗法により反転し、目的の指向性パターンを実現するFIRフィルタ群を求めます。
ここで重要なのが正則化パラメータ(β)です。
これは周波数に依存する係数で、行列の対角成分に加算されます。
低域で逆行列が不安定になり雑音が増幅されるのを防ぐ役割を持ちますが、強くかけすぎると指向性の精度が犠牲になります。
この研究では、100 Hzから10 kHzの帯域では正則化を低く保ち、指向性の精度を優先しました。
100 Hz未満では正則化を強め、雑音の増幅を抑えています。
また、フィルタを因果的にするため、目標応答に因果化遅延を挿入し、フィルタの主要ピークがフィルタ長の中央付近にくるよう設計しました。
最後に、実時間処理の実装です。
計算されたフィルタは、Linuxベースのmini-ITXクアッドコア計算機上で、BruteFIRを用いた分割畳み込みによって実時間実行されました。
分割畳み込みとは、インパルス応答を複数のセグメントに分割し、それぞれをFFTで処理することで遅延を抑えるブロック単位の高速畳み込み手法です。
BruteFIRはLinux向けの実時間畳み込みエンジンで、多数のフィルタを扱え、ダブルバッファリングによってフィルタ係数を途切れなく更新できます。
仮想マイクの向きは、ジョイスティックと、パノラマ静止画またはライブ映像に重ねたGUIで操作します。
仮想カーディオイドは、どの程度の性能に達したのか
合成された仮想カーディオイドマイクの性能を、主要な指標に沿って見ていきます。
指向性です。
1次から6次までの仮想カーディオイドが合成されました。
6次ではビーム幅が60度で一定となり、比較対象とされたSennheiser MKH 70-1ショットガンマイクよりも狭く、周波数依存性も小さい結果です。
無指向性と単一指向性の使い分け 録音で何が変わるのかでは、指向性による収音の違いを解説していますが、この研究はその指向性そのものを後から合成できることを示した点で、一歩先の提案といえます。
周波数特性です。
すべての合成パターンにおいて、100 Hzから10 kHzまでほぼ平坦な周波数応答が得られました。
雑音特性です。
6次の仮想カーディオイドのA特性背景雑音は約26 dB(A)でした。
単一カプセルの21 dB(A)と比べて高い値です。
これは高次の指向性を合成するために多数のカプセルの雑音が重畳されるためで、プリアンプのゲインを上げた状態での測定値です。
なお、このゲイン設定でのデジタルクリッピングレベルは107 dB SPL peakです。
遅延補正の効果も確認されました。
距離誤差を30 mmから2 mmへ補正したことで、高域でのポーラパターンが改善されています。
この手法には、どのような限界があるのか
著者らは三つの限界を明示しています。
第一に、低域での指向性精度の低下です。
高次の仮想マイクでは低域雑音が増加するため、100 Hz未満では正則化パラメータを大きく設定せざるを得ず、その帯域での指向性の正確さは犠牲になっています。
第二に、より広い帯域で平坦な応答を強制しようとすると、さらに長いフィルタが必要になり、低域雑音の増幅を招く恐れがあることです。
とくに超低域まで帯域を伸ばす場合に顕著になります。
第三に、高い周波数では空間的エイリアシングによってポーラパターンが劣化することです。
3次カーディオイドでこの現象が観察されています。
著者らが扱わなかった課題も二つあります。
一つは、合成されたのが高次カーディオイドパターンに限られており、任意の指向性関数の実現には至っていない点です。
もう一つは、性能評価が無響室および半無響室での測定に限られており、残響のある環境での振る舞いは評価されていない点です。
以上から、この研究の知見がそのまま適用できるのは、無響室に近い制御された音響空間、あるいは直接音が支配的な収音条件に限られます。
この研究をどう受け止めるか
Farinaらの研究は、球状マイクアレイの信号処理において、球面調和関数という中間表現を経由しない直接的なアプローチを具体的に示した点で、この分野に一つの選択肢を加えました。
トランスデューサの個体差や筐体の音響的影響を、測定によってフィルタ設計に織り込むという考え方は、実装上避けられない課題に対する現実的な解答です。
実時間で7本の仮想マイクを合成し、ジョイスティックとGUIで動的に操作できるシステムとして完成させたことも、研究を実験室から現場へ近づける一歩でした。
一方で、任意指向性への拡張や残響環境での評価が残された課題であることは、著者自身が明確に認めています。
後続の研究がどこまでこれらの課題に答えたかは、また別の論文を待つことになります。
参考資料
Angelo Farina, Andrea Capra, Lorenzo Chiesi, Leonardo Scopece, "A Spherical Microphone Array for Synthesizing Virtual Directive Microphones in Live Broadcasting and in Post Production," AES 40th International Conference, Tokyo, Japan, 2010.
原典の主張は、A Spherical Microphone Array for Synthesizing Virtual Directive Microphones in Live Broadcasting and in Post Production をご参照ください。

