In-depth Review of VALL-E: Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Tutorials

VALL-E 深度评测:神经编解码语言模型零样本文本转语音合成器

从三秒参考音频片段实现零样本 TTS 曾看似不可能,直到 VALL-E 问世。这篇深度评测深入揭示了微软是如何做到的。

从三秒参考音频片段实现零样本 TTS 曾看似不可能,直到 VALL-E 问世,这篇深度评测深入揭示了微软是如何做到的。该模型将现成的神经音频编解码器作为分词器,然后训练语言模型来预测以文本和简短讲话者提示为条件的声学令牌。将合成重新框架化为条件下一标记预测,而不是连续信号回归,这是实现语境内讲话者自适应的概念关键。

该评测介绍了两阶段自回归加非自回归解码方案、60,000 小时 LibriLight 衍生的训练语料库,以及显示 VALL-E 在自然度和讲话者相似度方面超越现有最先进水平的评估。它还涵盖了令人惊讶的涌现行为:该模型将讲话者的情感和录音的声学环境从提示词传递到输出。对于 TTS 工程师、语音克隆初创公司以及任何权衡编解码器-LM 方法与扩散或流匹配替代方案的人来说,这是参考演练。当你有时间时,不妨观看完整的架构导览。