对 Deepmind 的 WaveNet 用于 TTS/音频合成的回顾(你觉得它像 GPT 吗?)
在 Tacotron 之前,在 VALL-E 之前,在神经编解码器将音频转换为令牌之前,DeepMind 的 WaveNet 论文表明神经网络可以逐个样本生成原始音频波形,并击败每个参数
在 Tacotron 之前,在 VALL-E 之前,在神经编解码器将音频转换为令牌之前,DeepMind 的 WaveNet 论文表明神经网络可以逐个样本生成原始音频波形,并在自然度上击败每个参数和串联 TTS 系统。现在看看,戴上 GPT 形状的眼镜,两者的相似之处是不可思议的:一个完全概率的自回归模型,根据所有先前的样本调节每个样本 - 音频语言模型,五年前 LLMs 成为一个家喻户晓的术语。
该评论介绍了使其在 16 kHz 下工作的架构:扩张因果卷积以指数方式增长感受野、门控激活、残差和跳跃连接。它还涵盖了 WaveNet 超越 TTS 所展示的功能——交换声音的扬声器调节、作为副产品的音乐生成,甚至作为判别模型的竞争性音素识别。如果您想了解现代语音生成人工智能实际上是从哪里开始的,以及为什么音频上的自回归令牌范例不断在较新的 TTS 系统中回归,那么这次回顾会是一个很好的基础。
