I-JEPA: النموذج العالمي الأول للرؤية الحاسوبية ليان ليكون
ظل يان ليكون يجادل منذ سنوات بأن التدريب المسبق التوليدي هو الرهان الخاطئ لبناء آلات تفهم العالم.
ظل يان ليكون يجادل منذ سنوات بأن التدريب المسبق التوليدي هو الرهان الخاطئ لبناء آلات تفهم العالم. I-JEPA هو أول إصدار Meta AI ملموس لوضع هذه الأطروحة في كود لرؤية الكمبيوتر. فبدلاً من إعادة بناء وحدات البكسل أو محاذاة التعزيزات، فإنه يتنبأ بتمثيلات مجردة للكتل المستهدفة المقنعة من كتلة سياقية واحدة - مما يعني تعلم دلالات دون إنشاء صورة على الإطلاق.
تتعمق الإرشادات التفصيلية في سبب أهمية استراتيجية الإخفاء (يجب أن تكون الكتل المستهدفة كبيرة بما يكفي لفرض التنبؤ الدلالي، ويجب أن تكون كتل السياق مفيدة مكانيًا) ولماذا تتجنب البنية التنبؤية للتضمين المشترك انهيار التمثيل الذي يطارد الأساليب المتناقضة. أرقام الكفاءة هي العنوان الرئيسي: تم تدريب ViT-Huge/14 على ImageNet في أقل من 72 ساعة على 16 طائرة A100، وحقق تصنيفًا قويًا للتسديدات المنخفضة مع 12 مثالًا مسمى فقط لكل فئة. بالنسبة لأي شخص يتتبع التعلم الخاضع للإشراف الذاتي خارج MAE وDINO - أو لديه فضول حول الشكل الفعلي للنموذج العالمي على طراز LeCun عند طرحه - يعد هذا دليلًا تمهيديًا مفيدًا حول الاتجاه الذي قد يتجه إليه التعلم التمثيلي بعد ذلك.
