I-JEPA:Yannn LeCun 的首個計算機視覺「世界模型」
多年來,Yann LeCun 一直在論證生成式預訓練對於構建理解世界的機器來說是錯誤的方向。
多年來,Yann LeCun 一直在論證生成式預訓練對於構建理解世界的機器來說是錯誤的方向。I-JEPA 是第一個具體的 Meta AI 版本,將該論點轉化為計算機視覺的代碼。它不是重構像素或對齐增強,而是從單個背景塊預測被遮罩目標塊的抽象表示——學習語義而不曾生成圖像。
演講深入探討了為什麼遮罩策略很重要(目標塊必須足夠大以強制語義預測,背景塊必須在空間上具有信息性)以及為什麼聯合嵌入預測架構規避了困擾對比方法的表示崩潰。效率數字是頭條:ViT-Huge/14 在 16 個 A100 上不到 72 小時內在 ImageNet 上訓練,使用每類僅 12 個標記示例達到強大的低樣本分類。對於任何追蹤超越 MAE 和 DINO 的自監督學習的人——或對當它發布時 LeCun 風格的世界模型實際上看起來像什麼感到好奇的人——這提供了一個有用的入門,說明表示學習可能下一步去向哪裡。
