目次
マイクアレイで複数の楽器を録るとき、あとから各楽器の音を分離して「これは何の楽器か」を自動で判定できたら便利です。
ただ、分離を通した音にはほかの楽器の音が混じって残ります。
この記事が答えるのは、分離処理を通した音でも楽器の自動分類は実用に足る精度を保てるのか、という問いです。
音源分離のあとの音で、楽器分類はなぜ難しいのか
マイクロホンアレイとは、複数のマイク素子を配置した収音装置です。
この研究が対象にするのは19チャンネルのZYLIA ZM-1です。
マイクアレイの用途による違いは、3Dアンビエンス録音にはどのマイクアレイが適しているのか、その研究を読むでも扱っています。
音源分離アルゴリズムとは、録音シーンに共存する複数の音源を、それぞれの音に分け直す処理です。
ビームフォーミング(マイクロホンアレイの指向性処理)に楽器分類を組み込むことが、この研究の狙いの一つです。
問題は、音源分離を経た信号にはほかの音源からの干渉が残ることでした。
干渉が残ると分類精度が下がる懸念があり、それがZYLIA ZM-1のようなアレイへ楽器分類システムを実用導入する際の妨げになると考えられていました。
一方で、楽器分類の結果を分離アルゴリズムに戻せば、音源分離アルゴリズムそのものを改善できる可能性もあります。
分離の影響を、どうやって確かめたのか
実際に何度も録音して確かめる代わりに、この研究は既存の楽器サンプルを加工して仮想的なアレイ録音を作る方法を採りました。
使ったのはMagenta NSynthというデータセットで、11の楽器カテゴリ、30万を超える単発のソロ楽器サンプルが収められています。
NSynthが選ばれたのは、ソロ楽器のサンプルで録音空間の影響が少なく、畳み込みや混合による前処理の自由度が高いからです。
インパルス応答とは、音源からマイクロホンアレイの各素子へ届くまでの応答を角度ごとに記録したものです。
この研究では、ZYLIA ZM-1で収録した19チャンネルのインパルス応答をサンプルに畳み込むことで、アレイで録った響きを模擬しました。
畳み込みとは、サンプルにインパルス応答を掛け合わせて、アレイで収録された響きを付与する処理です。
5つの主要方位を選び、各方位につき方位±10°、仰角±30°の変動を加えた、計25種類のインパルス応答を使いました。
方位角と仰角は、仮想録音シーンでの音源配置を決める水平角と仰角です。
続いて、2から5の楽器が共存する仮想録音シーンをモノラルで混合しました。
これは音源分離アルゴリズムを適用したあとの信号を再現するためです。
分離後も残る副次的な信号の振幅には、RMS比に基づく係数0.11を掛けました。
こうした畳み込みと混合の前処理は、学習データを仮想的に増やすデータ拡張の役割も果たします。
モノラルの混合にしたのは、単体で使える音源分離ツールが当時利用できなかったためです。
畳み込みと混合による前処理で分離後の信号を模擬できれば、実録音に必要な長時間の作業を省ける、と論文は述べています。
学習には二種類のネットワークを使いました。
CNN(畳み込みニューラルネットワーク)とは、この研究で楽器の分類に使う学習モデルです。
1D CNNは生波形(生の音声波形)を、2D CNNはメルスペクトログラム(音声分類のための時間-周波数表現)を入力に用います。
1D CNNは43エポック、2D CNNは50エポックの訓練を行い、テスト精度と損失を比べました。
分離の影響は、実際どれだけだったのか
モデルとデータセットの組み合わせごとに測ったテスト精度は、次の表のとおりです。
1D CNNと2D CNNのテスト精度は、どちらのデータセットでも大きくは違いませんでした。
いちばん注目されるのは、前処理を経た2D CNNです。
テスト精度は0.58で、前処理なしの2D CNNの0.60に比べて0.02低いだけでした。
つまり、音源分離を模した処理を加えても2D CNNの精度低下はわずかで、分離処理は楽器分類を導入するうえで大きな障害にはならない、と研究者たちは結論づけています。
2D CNNのテスト損失は、オリジナルデータセットで1.28、前処理済みデータセットで1.04でした。
前処理済みのデータセットでは、訓練中の精度と損失の変動が少なく、より滑らかな勾配を示しました。
正則化の効きかたはモデルで分かれました。
L2正則化を加えると1D CNNのテスト精度は0.10向上しましたが、2D CNNでは効果が見られませんでした。
一方、NSynthについて文献中で報告されている最高のテスト精度は0.73です。
この研究の2D CNNの0.60には、まだ改善の余地があると論文は述べています。
この結果は、どこまで信用できるのか
結論がどこまで及ぶかについて、著者自身がいくつか留保を付けています。
一つは分離結果の再現方法です。
単体で使える音源分離アルゴリズムのツールが当時利用できなかったため、分離後の信号はモノラル混合で再現するにとどまり、実際の分離アルゴリズムの出力を使った評価は行われていません。
そのうえモノラル混合では、信号の空間情報がほぼ失われています。
もう一つは精度の水準です。
2D CNNのテスト精度0.60は、より高度なモデルで改善できる余地がありますが、それはこの研究の主目的ではありませんでした。
また、NSynthが単発サンプル(各楽器の音域を半音ごとに収録したもの)であるという特性が、精度の制限に関係していると考えられます。
加えて、YamNetやVGGishといった既存の音響イベント・シーン分類器をビームフォーミングのソフトウェアへ組み込む点は、今後の検討とされ、この研究では評価されていません。
この研究は、どんな位置づけになるのか
マイクロホンアレイで録った音を、あとから方向ごとに分けたり特定の音源を取り出したりする技術は、録音の分野でひとつの流れをつくっています。
そうした処理の先に、取り出した音が何の楽器かを自動で判定する分類を置くのは、自然な延長です。
この研究は、その延長線上にある懸念、つまり分離処理が分類精度を落とすのではないかという点を、実際にモデルを学習させて数値で確かめました。
結果として、分離を模した前処理を経ても2D CNNの精度低下はわずかでした。
ただしこれは、モノラル混合による再現という条件つきの結論であり、実機の分離出力を使った評価は先の課題として残っています。
この研究は、アレイ録音と自動分類を結ぶ経路の見通しを、数値で示したものという位置づけになります。
参考資料
Automatic audio source classification system for recordings captured with microphone array
著者:Michał Chrul、Andrzej Rumiński、Tomasz Żernicki、Ewa Łukasik
発表年:2021年
掲載:AES 150th Convention, Online, 2021年5月25日から28日, Convention Paper 10481
原典の主張は、Automatic audio source classification system for recordings captured with microphone array をご参照ください。

