Review of HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis

Tutorials

HiFi-GAN 리뷰: 효율적이고 고충실도 음성 합성을 위한 생성 적대 네트워크

오랫동안 신경 보코더는 선택을 강요했습니다: WaveNet과 같은 자동회귀 모델은 아름다운 오디오를 제공했지만 고통스럽게 느렸고, GAN 기반 파형 생성기는 빠르지만 눈에 띄게 낮은 품질이었습니다.

오랫동안 신경 보코더는 선택을 강요했습니다: WaveNet과 같은 자동회귀 모델은 아름다운 오디오를 제공했지만 고통스럽게 느렸고, GAN 기반 파형 생성기는 빠르지만 눈에 띄게 낮은 품질이었습니다. HiFi-GAN이 그 간격을 좁혔습니다. 단일 V100에서 실시간의 167.9배로 22.05 kHz 오디오를 생성하고, 인간 녹음 범위의 평균 의견 점수에 도달하며, 현대 TTS 스택의 상당 부분에 대해 기본 보코더가 되었습니다.

이 리뷰는 그것이 작동하게 한 설계 통찰력에 초점을 맞춥니다: 음성은 많은 다양한 주기를 가진 정현파들의 합이므로, 판별기는 명시적으로 이러한 주기들을 살펴봐야 합니다. HiFi-GAN의 다중 주기 판별기(다중 스케일 판별기와 쌍을 이룬)는 생성기가 효율적인 상태를 유지하면서 충실도를 높이는 것입니다. 이 튜토리얼은 또한 멜 스펙트로그램 역변환을 위해 미지의 화자에게 얼마나 잘 일반화되는지, 엔드-투-엔드 TTS 동작, 그리고 CPU에서 실시간보다 13.4배 빠르게 실행되는 소형 변형을 다룹니다. 2024년에 TTS 제품용 보코더를 선택하고 HiFi-GAN이 여전히 합리적인 기본값인 이유를 이해하고 싶다면, 이 보코더 회고는 당신의 관심을 받을 가치가 있습니다.