[長評] 用於高保真影像產生的級聯擴散模型
在 Imagen 和 DALL-E 2 將擴散作為生成圖像的預設設定之前,這篇 Google Brain 論文列出了許多後來的文字到圖像系統悄悄借用的級聯擴散配方:從一個小的開始
在 Imagen 和 DALL-E 2 將擴散作為生成圖像的預設設定之前,這篇 Google Brain 論文提出了許多後來的文本到圖像系統悄然借用的級聯擴散配方:從一個小型低分辨率擴散模型開始,然後在頂部鏈接超分辨率擴散模型以進行上採樣。關鍵點是一種稱為條件增強的技術,它可以防止階段之間的複合誤差,結果是模糊糊狀和 256x256 下 4.88 FID 之間的差異。
Ho 等人的這篇長篇評論。深入研究了級聯設計、使其穩健的噪音調節技巧,以及擊敗 BigGAN-deep 和 VQ-VAE-2 的 ImageNet 基準測試結果。語音人員應該關心:級聯生成現在正在遷移到 TTS 和神經音頻編解碼器中,其中使用多級擴散來合成越來越自然的波形。如果您想在接觸現代音訊擴散工作之前打下基礎,那麼可以深入了解每個組件。
