Review DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation ~ Seed-TTS

Tutorials

评测 DiTAR:语音生成的扩散 Transformer 自回归建模 ~ Seed-TTS

Seed-TTS 团队回归了 DiTAR,这是对现代语音生成中最尴尬权衡之一的简洁答案:如何在不支付混合扩散加自回归堆栈通常要求的计算成本的情况下保持连续语音表示的灵活性,同时不接受这些组

Seed-TTS 团队带着 DiTAR 回来了,这是对现代语音生成中更尴尬的权衡之一的干净答案:如何在不支付混合扩散加自回归堆栈通常需要的计算成本的情况下保持连续语音表示的灵活性,并且不接受这些组合倾向于产生的次优输出?DiTAR 完全绕过离散语音令牌,使用基于补丁的框架,将语言模型与扩散 Transformer 配对以高效生成连续音频。

该审评深入探讨了模型核心的分而治之技巧——LM 处理聚合的补丁嵌入并将其交给扩散 Transformer 以产生以该输出为条件的下一个补丁——加上一个巧妙的推理时间旋钮,将温度重新定义为反向扩散 ODE 中的噪声注入点,为您在多样性和确定性之间提供清晰的刻度盘。广泛的缩放分析、关于鲁棒性、说话者相似性和自然性的零样本基准都在范围内,DiTAR 在各个方面都发布了 SOTA 数字。如果您正在跟踪 VALL-E 和 Seed-TTS 之后自回归语音生成的去向,这个深度探讨值得关注。