Tutorials
評測 DiTAR:用於語音生成的擴散 Transformer 自迴歸建模 ~ Seed-TTS
Seed-TTS 團隊帶著 DiTAR 回來了,這是對現代語音生成中最尷尬的權衡之一的乾淨答案:你如何在保持連續語音表示的靈活性而不支付計算
Tutorials
[長篇評論] Cascaded Diffusion Models for High Fidelity Image Generation
在Imagen和DALL-E 2將擴散設定為生成式影像的預設之前,這篇Google Brain論文奠定了Cascaded Diffusion的方案,許多後來的文字轉圖像系統都悄悄地採用:從一個小
Tutorials
[短篇評論] Cascaded Diffusion Models for High Fidelity Image Generation
Cascaded Diffusion是許多現代生成工作背後的二階以上方案:用一個擴散模型生成小影像,然後交給超解析度擴散模型來添加高頻細
