Review Microsoft's VALL-E 2 (Achieving Human Parity in Zero-shot TTS)

Tutorials

마이크로소프트의 VALL-E 2 검토 (Zero-shot TTS에서 인간 수준 달성)

Zero-shot TTS는 많은 사람들이 여전히 몇 년 먼 것이라고 생각했던 선을 넘었습니다. 마이크로소프트의 VALL-E 2는 견고성, 자연스러움, 화자 유사성 측면에서 LibriSpeech와 VCTK 모두에서 인간 수준에 도달한 첫 번째 신경망 코덱 언어 모델입니다.

Zero-shot TTS는 많은 사람들이 여전히 몇 년 먼 것이라고 생각했던 선을 넘었습니다. 마이크로소프트의 VALL-E 2는 견고성, 자연스러움, 화자 유사성 측면에서 LibriSpeech와 VCTK 모두에서 인간 수준에 도달한 첫 번째 신경망 코덱 언어 모델입니다. 이 상세한 검토는 팀이 어떻게 거기에 도달했는지를 풀어내며, 원래 VALL-E의 가장 큰 실패 모드인 폭주하는 디코딩 루프와 길고 복잡하거나 반복되는 입력 문장에서의 취약한 출력을 조용히 해결하는 두 가지 기만적으로 단순한 아키텍처 조정에 초점을 맞춥니다.

핵심 기술은 토큰 반복 이력을 조건으로 하여 핵심 샘플링을 재구성하여 디코딩을 안정화하고 무한 루프를 제거하는 Repetition Aware Sampling과 코덱 토큰을 그룹으로 청킹하여 시퀀스 길이를 줄이고 추론을 가속화하며 긴 시퀀스 모델링의 도전 과제를 해결하는 Grouped Code Modeling입니다. 이 검토는 프로덕션 TTS를 구축하는 모든 사람에게 이 기술들이 중요한 이유를 설명합니다. 전통적으로 어려운 문장에서도 일관되게 더 높은 품질의 출력, 더 강한 화자 유사성, ALS나 실어증을 가진 사람들의 음성을 복구하는 것과 같은 접근성 응용 프로그램으로의 합리적인 경로입니다. 코덱 LM, 신경망 보코더, 또는 zero-shot 음성 클로닝에서 작업한다면, 논문을 자세히 살펴보기 전에 이 분석이 시작할 장소입니다.