In-depth Review of Google's SoundStream: An End-to-End Neural Audio Codec

Tutorials

Google SoundStream 深度回顾:端到端神经音频编码器

神经编码器悄然成为现代生成式音频的基础层,SoundStream 是启动这一切的论文之一。

神经编码器悄然成为现代生成式音频的基础层,SoundStream 是启动这一切的论文之一。Google 的端到端设计将完全卷积的编码器/解码器与残差向量量化器配对,所有这些都使用从 TTS 和语音增强领域借用的对抗性和重建损失联合训练。令人瞩目的结果是:在 3 kbps 下,SoundStream 击败 12 kbps 的 Opus,并在 24 kHz 音频上接近 9.6 kbps 的 EVS,跨越语音、音乐和一般声音。

除了压缩数字,设计选择对任何发布语音技术的人都很重要。量化器层中的结构化丢弃允许单一模型跨 3-18 kbps 而无需重新训练,并且该架构在智能手机 CPU 上以实时流式推理的方式运行。该论文还将背景噪声抑制直接折叠到编码器或解码器端的编码器中,没有增加的延迟。如果您正在开发神经 TTS 令牌、低比特率通话或设备上音频管道,这个演示是对后来推动 AudioLM 及其后代的想法的坚实基础。点击播放以查看架构分解和主观评估结果。