变分自动编码器 (VAE) 和重新参数化技巧 - 重新审视经典生成模型
在扩散模型之前,在归一化流之前,在潜在扩散模型悄悄地将 VAE 编码器嵌入到每个严肃的生成堆栈之前——有 Kingma 和 Welling 的 2013 年论文介绍变分自编码器
在扩散模型之前,在归一化流之前,在潜在扩散模型悄悄地将 VAE 编码器嵌入到每个严肃的生成堆栈之前——有 Kingma 和 Welling 的 2013 年论文介绍了变分自编码器和重参数化技巧。这次回顾回到了经典论文,它使得随机梯度下降通过采样操作成为可能,并展示了这些想法为什么仍然推动从 Stable Diffusion 到神经语音编解码器(如 EnCodec 和 SoundStream)的现代生成 AI。
演练涵盖了论文解决的核心问题:如何在具有连续潜在变量和难以处理的后验分布的有向概率模型中进行高效推理和学习,在大规模数据集上进行扩展。重参数化技巧是关键——将采样的潜在表示为参数的确定函数加注入的噪声,这使得梯度可以干净地流动并解锁可扩展的随机变分推理。期望看到 ELBO 的干净推导、启发了每个现代编码器网络的识别模型框架,以及足够的直觉来理解为什么 VAEs 仍然作为潜在空间骨干出现在当今许多生成系统中。如果你想真正理解潜在内发生的情况,值得花 10 分钟——这是一篇罕见的论文阅读,它深入讨论工程,而不仅仅是摘要。
