XLS-R: Self supervised Cross lingual Speech Representation Learning at Scale

Tutorials

XLS-R: تعلم تمثيل الكلام عبر اللغات تحت الإشراف الذاتي على نطاق واسع

إلى أي مدى يمكنك دفع التدريب المسبق على الكلام عبر اللغات قبل أن يجف البئر؟

إلى أي مدى يمكنك دفع التدريب المسبق على الكلام عبر اللغات قبل أن يجف البئر؟ يجيب XLS-R الخاص بـ Meta مع 2 مليار معلمة تم تدريبها على 436000 ساعة من الصوت غير المسمى عبر 128 لغة - وهو قفزة كبيرة الحجم مقارنة بـ XLSR-53، وعند الإصدار، أكبر نموذج كلام عام متعدد اللغات بهامش واسع.

النتائج تدعم قصة المقياس. يضع XLS-R أحدث ما توصلت إليه التكنولوجيا في أنظمة BABEL وCommonVoice والتعرف على الكلام VoxPpuli، وربما الأكثر إثارة للدهشة - في ترجمة الكلام إلى اللغة الإنجليزية، حيث يتفوق على الأنظمة السابقة المبنية على نماذج نصية أكبر بكثير. تتناول المحادثة عملية تنظيم البيانات عبر تلك اللغات الـ 128، وكيف تصمد بنية wav2vec 2.0 عند معلمات 2B، وما الذي يتعطل عندما تحاول ضبط شيء بهذا الحجم على بيانات منخفضة الموارد. إذا كنت تعمل على أي مهمة كلامية بلغة لا تغطيها HuggingFace بالفعل، فمن المحتمل أن يكون XLS-R هو نقطة التحقق الأولى التي يجب عليك تجربتها - ويوضح الغوص العميق السبب.