Review of HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis

Tutorials

HiFi-GAN 回顾:高效且高保真语音合成的生成对抗网络

长期以来,神经声码器迫使您选择立场:像 WaveNet 这样的自回归模型给您华丽的音频但速度惊人地缓慢,而基于 GAN 的波形生成器速度快但质量明显更低。

长期以来,神经声码器迫使您选择立场:像 WaveNet 这样的自回归模型给您华丽的音频但速度惊人地缓慢,而基于 GAN 的波形生成器速度快但质量明显更低。HiFi-GAN 缩小了这个差距。它在单个 V100 上以 167.9 倍的实时速度生成 22.05 kHz 音频,达到人类录音范围内的平均意见分数,并已成为现代 TTS 堆栈中很大一部分的默认声码器。

该回顾重点关注使其工作的设计洞察:语音是具有许多不同周期的正弦波之和,因此鉴别器需要明确查看这些周期。HiFi-GAN 的多周期鉴别器(与多尺度鉴别器配对)是在保持生成器精简的同时提高保真度的原因。演示还涵盖了它对于未见说话人的梅尔频谱图反演的泛化性能、其端到端 TTS 行为,以及一个小占用空间的变体,它在 CPU 上的运行速度比实时快 13.4 倍。如果您正在为 2024 年的 TTS 产品选择声码器,并想了解为什么 HiFi-GAN 仍然是明智的默认选择,这个声码器回顾值得您关注。