[Short Review] Deduplicating Training Data Makes Language Models Better

Tutorials

[مراجعة قصيرة] إلغاء تكرار بيانات التدريب يجعل نماذج اللغة أفضل

ما مقدار "التعميم" في نموذج لغتك الذي يعتبر في الواقع مجرد قلس؟

ما مقدار "التعميم" في نموذج لغتك الذي يعتبر في الواقع مجرد قلس؟ وضع بحث Google رقمًا عليه: ما يزيد عن 1% من مخرجات LM غير الفورية يتم نسخها حرفيًا من بيانات التدريب، وتحتوي النصوص القياسية مثل C4 على جمل مكررة عشرات الآلاف من المرات. تقدم ورقتهم البحثية أداتين فعالتين لإلغاء البيانات المكررة تعملان على تجريد السلاسل الفرعية شبه المكررة والسلاسل الفرعية الطويلة المتكررة من مجموعات البيانات على نطاق الويب، مع تأثيرات مذهلة في المراحل النهائية.

النماذج التي تم تدريبها على البيانات المنظفة تحفظ أقل بعشر مرات، وتتقارب في خطوات أقل، وتنتج أرقام تقييم أكثر جدارة بالثقة لأن تداخل اختبار التدريب ينخفض بشكل حاد أيضًا. بالنسبة لفرق الذكاء الاصطناعي الصوتي التي تقوم ببناء واجهات خلفية LLM لوكلاء المحادثة، أو تدريب نماذج لغة الكلام على النصوص المحذوفة، يعد هذا تذكيرًا بأن نظافة مجموعة البيانات غالبًا ما تتفوق على الذكاء المعماري. تغطي هذه المراجعة القصيرة خوارزميات إلغاء البيانات المكررة، وقياسات الحفظ، والكود الذي تم إصداره. يستحق خمس دقائق إذا كانت جودة البيانات قريبة من سباقك التالي.