هل يتم تسجيل قلبة ناثان تشن الرباعية بواسطة Mixture-of-Experts؟ الجزء 2: GLaM: قياس فعال للنماذج اللغوية مع MoE
الجزء 2 من سلسلة MoE المصغرة ينتقل إلى GLaM، نموذج اللغة Mixture-of-Experts من Google الذي يحتوي على 1.2 تريليون معامل والذي يطابق أو يتفوق على GPT-3 في معايير الصفر والواحد والقليل من الأمثلة بينما ينشط فقط حوالي 8% من معاملات
الجزء 2 من سلسلة MoE المصغرة ينتقل إلى GLaM، نموذج اللغة Mixture-of-Experts من Google الذي يحتوي على 1.2 تريليون معامل والذي يطابق أو يتفوق على GPT-3 في معايير الصفر والواحد والقليل من الأمثلة بينما ينشط فقط حوالي 8% من معاملات هذا النموذج لكل رمز ويحرق حوالي ثلث طاقة التدريب من GPT-3. قصة الكفاءة هي العنوان الرئيسي: التنشيط المتناثر يعني أن الحسابات لكل استدلال أصغر بكثير مما يشير إليه عدد المعاملات.
تقدم هذه المراجعة تحليلاً لتوجيه الخبراء في GLaM وتجميع بيانات التدريب وأرقام التقييم التي تجعل حجة التوسع المتناثر ملموسة. بالنسبة لأشخاص الذكاء الصوتي الذين يقارنون نماذج LLM الكثيفة مقابل المتناثرة لمساعدات الصوت، أو يفكرون في نماذج أساس الكلام القائمة على MoE، فإن GLaM هي دراسة الحالة التجريبية التي حولت MoE من فضول إلى اعتبار نشر جاد. يستعرض الغوص العميق ما أثبتته GLaM وما تركته كعمل مفتوح للجيل التالي من النماذج المتناثرة.
