DiTAR 검토: 음성 생성을 위한 Diffusion Transformer 자기 회귀 모델링 ~ Seed-TTS
Seed-TTS 팀이 DiTAR로 돌아왔으며, 이는 현대 음성 생성의 더 어색한 트레이드오프 중 하나에 대한 명확한 답입니다.
Seed-TTS 팀이 DiTAR로 돌아왔으며, 현대 음성 생성의 더 어색한 트레이드오프 중 하나에 대한 명확한 답입니다. 하이브리드 확산-자기 회귀 스택이 일반적으로 요구하는 계산 비용을 지불하지 않고도 연속 음성 표현의 유연성을 어떻게 유지할까요, 그리고 그러한 조합이 생성하는 경향이 있는 차선의 출력으로 타협하지 않고? DiTAR은 이산 음성 토큰을 완전히 회피하여 언어 모델을 확산 Transformer와 쌍을 이루어 연속 오디오를 효율적으로 생성하는 패치 기반 프레임워크를 사용합니다.
이 검토는 모델의 핵심에 있는 분할과 정복 트릭을 파고듭니다. LM은 집계된 패치 임베딩을 씹고 확산 Transformer에 넘겨 그 출력을 조건으로 하는 다음 패치를 생성합니다. 또한 온도를 역 확산 ODE의 노이즈 주입 포인트로 재정의하여 다양성과 결정론 사이에 명확한 다이얼을 제공하는 훌륭한 추론 시간 노브입니다. 광범위한 스케일링 분석, 견고성, 화자 유사성, 자연스러움에 대한 zero-shot 벤치마크는 모두 범위 내이며, DiTAR은 모든 면에서 SOTA 숫자를 게시합니다. VALL-E와 Seed-TTS 이후 자기 회귀 음성 생성이 어디로 향하고 있는지 추적 중이라면, 이 심화 분석은 대기할 가치가 있습니다.
