Scaling Laws for Neural Language Models

Tutorials

قوانين القياس لنماذج اللغة العصبية

قبل أن تجعل GPT-3 عملية القياس أمرًا لا مفر منه، جعلت ورقة OpenAI هذه الأمر قابلاً للتنبؤ به.

قبل أن تجعل GPT-3 عملية القياس أمرًا لا مفر منه، جعلت ورقة OpenAI هذه الأمر قابلاً للتنبؤ به. أجرى كابلان والمؤلفون المشاركون مئات الدورات التدريبية عبر حجم النموذج وحجم مجموعة البيانات وميزانية الحوسبة، ووجدوا أن فقدان نموذج اللغة يتبع قوانين الطاقة النظيفة عبر سبعة أوامر أسية. لقد أدت الآثار المترتبة على ذلك إلى إعادة توصيل المجال: نظرًا لميزانية الحوسبة الثابتة، يوجد حجم مثالي للنموذج وعدد الرموز المميزة، وهو في الغالب ليس ما كان يفترضه الممارسون.

تغطي الإرشادات التفصيلية الكميات الحاكمة الثلاثة، ولماذا تكون تفاصيل الهندسة المعمارية أقل أهمية مما تعتقد، وكيف انتهى الأمر بالحدود الحسابية المثالية للورقة إلى توجيه كل شيء بدءًا من GPT-3 إلى Chinchilla إلى نماذج أساس الكلام الحديثة. هناك أيضًا ملاحظة حول خطأ اكتشفه مقدم العرض بشأن ديناميكيات حجم الدُفعة - وهو أمر يستحق الاستماع إليه إذا كنت مهتمًا بالإعداد التجريبي. إذا اضطررت في أي وقت مضى إلى تبرير ميزانية التدريب أو الشرح لصاحب المصلحة لماذا يكون الحجم الأكبر أفضل حقًا هنا، فهذه قراءة أساسية توفر عليك الكثير من التلويح باليد. اصطف في قائمة الانتظار.