變分自編碼器(VAE)和重新參數化技巧 - 重溫經典生成模型
在擴散模型出現之前,在正規化流出現之前,在潛在擴散模型悄悄地將 VAE 編碼器融入每個認真的生成堆棧之前——有 Kingma 和 Welling 在 2013 年發表的論文介紹變分自編碼
在擴散模型出現之前,在正規化流出現之前,在潛在擴散模型悄悄地將 VAE 編碼器融入每個認真的生成堆棧之前——有 Kingma 和 Welling 在 2013 年發表的論文介紹了變分自編碼器和重新參數化技巧。這次重溫回到了經典著作,它首次使通過採樣操作的隨機梯度下降成為可能,並展示了這些想法為什麼仍然為從 Stable Diffusion 到神經語音編碼器(如 EnCodec 和 SoundStream)的現代生成人工智能提供動力。
本演練涵蓋了論文解決的核心問題:如何在具有連續潛變量和難以計算的後驗分佈的有向概率模型中進行有效的推理和學習,並在大型數據集上進行擴展。重新參數化技巧是關鍵——將採樣的潛變量表示為參數加注入噪聲的確定性函數,這使梯度能夠清潔地流動並解鎖可擴展的隨機變分推理。期望看到 ELBO 的清晰推導、激發了每個現代編碼器網絡的識別模型框架,以及足夠的直覺來理解為什麼 VAE 仍然在今天許多生成系統中作為潛空間骨幹出現。如果您想真正理解潛變量內部發生的事情,值得花 10 分鐘。
