VALL-E의 심층 리뷰: 신경 코덱 언어 모델이 영샷 텍스트 음성 합성기
3초 참고 클립으로부터의 영샷 TTS는 VALL-E가 출시될 때까지 불가능해 보였지만, 이 심층 리뷰는 Microsoft가 정확히 어떻게 이를 달성했는지를 상세히 설명합니다.
3초 참고 클립으로부터의 영샷 TTS는 VALL-E가 출시될 때까지 불가능해 보였지만, 이 심층 리뷰는 Microsoft가 정확히 어떻게 이를 달성했는지를 상세히 설명합니다. 이 모델은 기성품 신경 오디오 코덱을 토크나이저로 취급한 후, 텍스트와 짧은 스피커 프롬프트에 조건화된 음향 토큰을 예측하도록 언어 모델을 훈련합니다. 연속 신호 회귀가 아닌 조건부 다음 토큰 예측으로 합성을 재구성하는 것이 문맥 내 스피커 적응을 가능하게 하는 개념적 전환점입니다.
이 리뷰는 2단계 자기회귀-비자기회귀 디코딩 방식, 60,000시간의 LibriLight 파생 훈련 코퍼스, 그리고 VALL-E가 자연성과 스피커 유사성에서 이전의 최고 수준을 능가함을 보여주는 평가를 다룹니다. 또한 모델이 프롬프트로부터 스피커의 감정과 녹음의 음향 환경을 출력으로 전달하는 놀라운 창발적 행동도 다룹니다. TTS 엔지니어, 음성 클로닝 스타트업, 그리고 codec-LM 접근법을 확산 또는 흐름 매칭 대안과 비교하고 있는 모든 사람들에게, 이것은 참고 설명입니다. 아키텍처 전체 투어를 할 시간이 있을 때 이것을 시청하세요.
