Review Microsoft's VALL-E 2 (Achieving Human Parity in Zero-shot TTS)

Tutorials

评测 Microsoft 的 VALL-E 2(在零样本 TTS 中实现人类水平)

零样本 TTS 刚刚越过了许多人认为还需要多年才能跨越的界线:Microsoft 的 VALL-E 2 是首个在 LibriSpeech 和 VCTK 上在鲁棒性、自然性和说话人

零样本 TTS 刚刚跨越了许多人认为还需要几年时间才能实现的界限:Microsoft 的 VALL-E 2 是第一个在 LibriSpeech 和 VCTK 上在鲁棒性、自然度和说话者相似性方面达到人类同等水平的神经编解码器语言模型。这篇详细的评论揭示了团队是如何实现这一目标的,重点关注两个看似简单的架构调整,这些调整悄然修复了原始 VALL-E 的最大故障模式——失控的解码循环以及用于破坏模型的长、复杂或重复输入句子的脆弱输出。

核心举措是重复感知采样(Repetition Aware Sampling)和分组代码建模(Grouped Code Modeling),前者通过调节令牌重复历史记录来重塑核心采样,以稳定解码并消除无限循环,后者将编解码器令牌分成组以缩小序列长度、加速推理并解决长序列建模的挑战。该评论阐述了为什么这些对于构建生产 TTS 的任何人都很重要:即使在传统的硬句子上也能始终保持更高质量的输出、更强的说话者相似性,以及为 ALS 或失语症患者恢复声音等辅助应用程序的合理途径。如果您研究编解码器 LM、神经声码器或零样本语音克隆,那么在深入研究本文之前,可以从这个细分开始。