Review DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation ~ Seed-TTS

Tutorials

Phi-3 のレビュー: 拡散 SoundStream 音声生成のための自己回帰モデリング ~ MusicGen

Seed-TTSチームがDiTARで戻ってきました。それは現代音声生成における、より厄介なトレードオフの1つに対するクリーンな答えです:連続音声表現の柔軟性を失わずに、comp

Seed-TTSチームはDiTARを持ってやって来ました。これは現代音声生成における最も厄介なトレードオフの1つへの洗練された答えです:ハイブリッド拡散自己回帰スタックが通常要求するコンピュート税を支払わずに、連続音声表現の柔軟性をどのように保つか、そしてこれらの組み合わせが通常生成する劣化された出力で満足しないこと。DiTARは離散音声トークンを完全に回避し、言語モデルを拡散Transformerフォーマーと組み合わせたパッチベースのフレームワークを使用して、連続音声を効率的に生成します。

このレビューでは、モデルの核にある分割統治トリックを掘り下げます — LMは集約されたパッチ埋め込みを処理し、その出力を条件として次のパッチを生成するために拡散Transformerフォーマーに引き継がれます — さらに、温度を逆拡散ODEのノイズ注入ポイントとして再定義する、洗練された推論時ノブがあり、多様性と決定性の間のクリーンなダイアルを提供します。広範なスケーリング分析、堅牢性、スピーカー類似性、自然さに関するゼロショットベンチマークはすべてスコープ内であり、DiTARは全体でSOTA数値を実現しています。VALL-EとSeed-TTSの後、自己回帰音声生成がどこへ向かっているのかを追跡している場合、このディープダイブはキューに入れる価値があります。