[Olewave's Review] CLIP (1/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
قبل أن يكون هناك BLIP أو LLaVA أو أي speech-LLM جدير بالاهتمام، كان CLIP موجوداً، وهنا حيث تبدأ القصة.
قبل أن يكون هناك BLIP أو LLaVA أو أي speech-LLM جدير بالاهتمام، كان CLIP موجوداً، وهنا حيث تبدأ القصة. يعدّ الجزء 1 من الاستعراض ثلاثي الأجزاء وصفة OpenAI المقابلة لما قبل التدريب للصور والنصوص: 400 مليون زوج (صور، نصوص) مستخرجة من الويب المفتوح، بنية مشفّرة مزدوجة، وهدف تدريب بسيط مثل "أي تسمية توضيحية تذهب مع أي صورة؟" كانت النتيجة قفزة نوعية في تمثيلات بصرية قابلة للنقل، والمخطط الأساسي لكمية من عمل نموذج الأساس متعدد الطرائق الذي تستعيره فرق الذكاء الصوتي الآن.
يضع الاستعراض دافع التخلص من الإشراف بالفئات الثابتة، استراتيجية تنسيق البيانات وراء مجموعة البيانات البالغة 400M زوج، وحيل وقت التدريب التي تجعل مسار ما قبل تدريب واحد يعمم عبر OCR والتعرف على الإجراءات وتحديد الموقع الجغرافي والتصنيف الدقيق. مطابقة CLIP بدون أمثلة على ImageNet مقابل ResNet-50، بدون لمس أي من صور تدريب ImageNet البالغة 1.28M، هي النتيجة الرئيسية، لكن الفهم الأعمق هو معماري: اللغة الطبيعية كإشارة إشراف تتسع بطرق البيانات الموسومة ببساطة لا يمكنها. اضغط على تشغيل إذا كنت تريد الأساس قبل القفز إلى الأجزاء 2 و 3، خاصة إذا كنت تحاول بناء نفس الحدس لوصفات ما قبل التدريب للصوت والنصوص و speech-LLM التي تسيطر على مكدس الذكاء الصوتي الآن.
