هل تم تسجيل الوجه الرابع لـ Nathan Chen بواسطة خليط من الخبراء؟ الجزء 2: GLaM: القياس الفعال لـ LMs باستخدام MoE
يتحول الجزء الثاني من السلسلة المصغرة MoE إلى GLaM، وهو نموذج لغة خليط الخبراء الذي يحتوي على 1.2 تريليون معلمة من Google والذي يطابق أو يتفوق على GPT-3 في معايير صفرية وواحدة وعدد قليل من اللقطات بينما يقوم بتنشيط حوالي 8٪ فقط من تكافؤه
يتحول الجزء الثاني من سلسلة MoE المصغرة إلى GLaM، وهو نموذج لغة خليط الخبراء الذي يحتوي على 1.2 تريليون معلمة من Google والذي يطابق أو يتفوق على GPT-3 في معايير صفر، وواحدة، وعدد قليل من الطلقات مع تنشيط حوالي 8٪ فقط من معلماته لكل رمز مميز وحرق ما يقرب من ثلث تدريب GPT-3. الطاقة. قصة الكفاءة هي العنوان الرئيسي: التنشيط المتناثر يعني أن الحوسبة لكل استدلال أصغر بشكل كبير مما يوحي به عدد المعلمات.
تقوم هذه المراجعة بتحليل توجيه الخبراء الخاص بـ GLaM، وتنظيم بيانات التدريب، وأرقام التقييم التي تجعل حجة القياس المتناثر ملموسة. بالنسبة للأشخاص ذوي الذكاء الاصطناعي الصوتي الذين يزنون النهايات الخلفية الكثيفة مقابل النهايات الخلفية LLM للمساعدين الصوتيين، أو يفكرون في نماذج أساس الكلام المستندة إلى MoE، فإن GLaM هي دراسة الحالة التجريبية التي حولت MoE من فضول إلى اعتبار نشر جاد. يستعرض الغوص العميق ما أثبته GLaM وما تركه كعمل مفتوح للجيل القادم من النماذج المتفرقة.
