Tutorials
[Olewave评论] CLIP (3/3): 从自然语言监督学习可转移的视觉模型
CLIP评论的最后一部分聚焦于结果部分,这是OpenAI对比图文模型从有趣想法转变为整个多模态堆栈基础原语的时刻。
Tutorials
[Olewave评论] CLIP (2/3): 从自然语言监督学习可转移的视觉模型
OpenAI的CLIP通过抛弃固定标签集,转而在从互联网上抓取的4亿个(图像、文本)对上进行训练,改变了计算机视觉的游戏规则。
Tutorials
[长评] 级联扩散模型高保真图像生成
在Imagen和DALL-E 2将扩散模型作为生成图像的默认选择之前,这篇Google Brain论文阐述了许多后来的文本到图像系统悄悄借鉴的级联扩散方案:从小
