SNRi Target Training for Joint Speech Enhancement and Recognition

Tutorials

SNRi ターゲット学習による音声強調と認識の結合学習

音声強調とASRの結合学習は明らかに見える。デノイザーを通じて認識損失をバックプロップするだけだ。しかし実際には、積極的なノイズ除去が音響モデルが依存する機能をしばしば歪めるので、複雑である。

音声強調とASRの結合学習は明らかに見える。デノイザーを通じて認識損失をバックプロップするだけだ。しかし実際には、積極的なノイズ除去が音響モデルが依存する機能をしばしば歪めるので、複雑である。このNTT論文はより清潔な目的を提案している。「クリーン」に強調するのではなく、ダウンストリームの音声認識器が実際に好む目標信号対ノイズ比に強調し、モデルがノイズ歪みのトレードオフ上のどこに座るかを学習させる。

SNRi ターゲットは発話ごとに推定され、強調ネットワークへの明示的な制御信号として使用される。これにより、フロントエンドは簡単なセグメントの過度な処理を停止し、難しいセグメントの過度な処理を停止する。このウォークスルーは、ターゲットがどのように導出されるか、標準の強調アーキテクチャにどのようにプラグインするか、そしてカスケード型および標準的な結合学習ベースラインの両方に対して提供するChiMEスタイルのベンチマークの改善をカバーしている。ノイズの多い現実世界の環境(自動車、コールセンター、ウェアラブル)にASRを展開しているなら、これはパイプラインに追加する微妙だが強力なトリックである。