BigSSL: Exploring the Frontier of Large-Scale Semi-Supervised Learning for Automatic Speech Recog

Tutorials

BigSSL: استكشاف حدود التعلم شبه الموجه واسع النطاق للتعرف التلقائي على الكلام

ماذا يحدث عندما تأخذ وصفة ASR شبه الموجهة التي تغلبت على أحدث التقنيات عند 100M معاملة وتستمر في التوسع؟

ماذا يحدث عندما تأخذ وصفة ASR شبه الموجهة التي تغلبت على أحدث التقنيات عند 100M معاملة وتستمر في التوسع؟ تجيب BigSSL من Google بـ Conformer بـ 8 مليارات معاملة مدرب على مليون ساعة من صوت YouTube غير المسمى، بالإضافة إلى عشرات الآلاف من ساعات البيانات الموجهة — وتظهر أن المكاسب تستمر في المجيء، خاصة على الذيل: المجالات منخفضة الموارد، والكلام المركب، والتعرف طويل الشكل.

الورقة في الواقع تقدم مساهمتين في واحدة. إنها دراسة تجريبية لما ينقطع وما يتسع عندما تدفع SSL بعد مليار معاملة، وهي توضيح أن مشفر مسبق التدريب واحد يمكنه أن يعمل كنقطة بداية عالمية لعشرات مهام ASR اللاحقة، مما يقلل من أرضية WER على YouTube والهاتفية ومعايير البحث الصوتي على حد سواء. يغطي الحديث خط أنابيب التدريب المسبق، ونتائج النقل عبر المجالات، والآثار العملية لأي شخص يزن ما إذا كان نهج نموذج الأساس منطقياً لمكدس الكلام الخاص بهم. يستحق الانتظار في الطابور إذا كنت تخطط لتشغيل التدريب التالي بحجم كبير.