[Long Review] Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis

Tutorials

[长评]从说话人验证到多说话人文本语音合成的迁移学习

这篇论文使零样本语音克隆变得实用:使用数千个嘈杂、无转录的语音来训练说话人编码器执行判别性验证任务,然后将这些嵌入输入 Tacotron 2 s

这篇论文使零样本语音克隆变得实用:使用数千个嘈杂、无转录的语音来训练说话人编码器执行判别验证任务,然后将这些嵌入输入 Tacotron 2 合成器和 WaveNet 声码器。结果是 TTS 系统可以通过几秒钟的参考音频来模仿新的扬声器,甚至是在训练期间从未见过的扬声器。

贾等人的这篇长篇评论。 Google 的工作详细介绍了所有三个模块:在验证目标上训练的说话人编码器、以嵌入为条件的序列到序列梅尔谱图合成器以及自回归 WaveNet 声码器。它还解压缩了量化编码器中需要多少说话者多样性才能概括的消融,以及随机采样的嵌入产生连贯的新颖声音的令人惊讶的结果。如果您要在语音克隆、个性化 TTS 或扬声器嵌入空间中构建任何内容,则需要阅读本文,并且深入探讨每一篇文章。