I-JEPA: Yannn LeCun's First 'World Model' for Computer Vision

Tutorials

I-JEPA: Yannn LeCun によるコンピューター ビジョンの最初の「世界モデル」

Yann LeCun 氏は、世界を理解するマシンを構築する上で、生成的事前トレーニングは間違った選択肢であると長年主張してきました。

Yann LeCun 氏は、世界を理解するマシンを構築する上で、生成的事前トレーニングは間違った選択肢であると長年主張してきました。 I-JEPA は、その理論をコンピュータ ビジョン用のコードに落とし込んだ最初の具体的な Meta AI リリースです。ピクセルを再構築したり拡張を整列させたりする代わりに、単一のコンテキスト ブロックからマスクされたターゲット ブロックの抽象表現を予測し、画像を生成することなくセマンティクスを学習します。

このウォークスルーでは、なぜマスキング戦略が重要なのか (ターゲット ブロックはセマンティック予測を強制するのに十分な大きさである必要があり、コンテキスト ブロックは空間的に情報を提供する必要がある)、そしてなぜ結合埋め込み予測アーキテクチャが対照的な手法につきまとう表現の崩壊を回避するのかを掘り下げています。効率の数値が見出しです。ViT-Huge/14 は、16 台の A100 で 72 時間未満で ImageNet 上でトレーニングされ、クラスあたりわずか 12 個のラベル付きサンプルで強力なローショット分類を達成しました。 MAE や DINO を超えて自己教師あり学習を追跡している人、または LeCun スタイルの世界モデルが出荷時に実際にどのように見えるかに興味がある人にとって、これは表現学習が次にどこに向かっているのかについての有用な入門書です。