I-JEPA:Yann LeCun的第一个计算机视觉'世界模型'
Yann LeCun多年来一直在主张生成式预训练是构建理解世界的机器的错误赌注。
Yann LeCun多年来一直在主张生成式预训练是构建理解世界的机器的错误赌注。I-JEPA是第一个具体的Meta AI版本,将该论文付诸代码用于计算机视觉。它不是重建像素或对齐增强,而是从单个上下文块预测掩蔽目标块的抽象表示——学习语义而无需生成图像。
该演练深入探讨了为什么掩蔽策略很重要(目标块必须足够大以强制语义预测,上下文块必须在空间上信息丰富),以及为什么联合嵌入预测架构规避了困扰对比方法的表示崩溃。效率数字是标题:在16个A100上,在72小时内训练的ViT-Huge/14在ImageNet上,使用仅12个标记示例每个类就达到了强大的低样本分类。对于任何追踪MAE和DINO之外的自监督学习的人——或者好奇当Yann LeCun风格的世界模型实际发货时是什么样子的人——这是一个关于表示学习可能朝哪个方向发展的有用入门。
