DeepMind WaveNet TTS/音频合成回顾(看起来像 GPT 吗?)
在 Tacotron 之前,在 VALL-E 之前,在神经编码器将音频转换为令牌之前,DeepMind 的 WaveNet 是展示神经网络可以逐样本生成原始音频波形并击败所有参数化和
在 Tacotron 之前,在 VALL-E 之前,在神经编码器将音频转换为令牌之前,DeepMind 的 WaveNet 是展示神经网络可以逐样本生成原始音频波形并在自然性上击败所有参数化和连接式 TTS 系统的论文。现在用 GPT 的眼光看,相似之处不可思议:一个完全概率化的自回归模型,将每个样本建立在所有先前样本的基础上——一个音频语言模型,比 LLM 成为家喻户晓的术语早五年。
该回顾介绍了在 16 kHz 频率下工作的架构:扩张因果卷积以指数级增长接收域、门控激活、残差和跳跃连接。它还涵盖了 WaveNet 在 TTS 之外展示的内容——说话人条件以交换声音、音乐生成作为副产品,甚至竞争性语音识别作为判别模型。如果您想看现代语音生成 AI 实际上从何开始,以及为什么自回归-令牌-音频范式在更新的 TTS 系统中不断出现,这个回顾是一个很好的基础。
