GoogleのSoundStreamの詳細レビュー: エンドツーエンドニューラルオーディオコデック
ニューラルコデックは静かに最新の生成的オーディオの基盤層となり、SoundStreamはそのプロセスを開始した論文の1つです。
ニューラルコデックは静かに最新の生成的オーディオの基盤層となり、SoundStreamはそのプロセスを開始した論文の1つです。Googleのエンドツーエンド設計は、完全な畳み込みエンコーダ/デコーダと残差ベクトル量子化子を組み合わせており、TTS および音声強化の世界から借りた敵対的および再構成損失でジョイントで学習されます。見出しの結果は印象的です:3 kbpsで、SoundStreamは24 kHzのオーディオで、音声、音楽、一般的な音全体にわたって、12 kbpsでOpusを上回り、9.6 kbpsでEVSに近づきます。
圧縮数値を超えて、音声技術を提供する人にとって設計上の選択が重要です。量子化層全体での構造化ドロップアウトにより、単一のモデルが再トレーニングなしで3~18 kbpsにまたがることができ、アーキテクチャはスマートフォンCPUでリアルタイムにストリーミング推論で実行されます。このペーパーは、背景ノイズ抑制をコデックに直接折り込んでいます。エンコーダー側またはデコーダー側で、追加の遅延なし。ニューラルTTSトークン、低ビットレート通話、またはオンデバイスオーディオパイプラインに取り組んでいる場合、このウォークスルーは後にAudioLMとその子孫に電力を供給したアイデアの固い基礎です。再生を押して、アーキテクチャの分解と主観的評価結果を見てください。
