WavLM: تدريب مسبق واسع النطاق تحت الإشراف الذاتي لمعالجة الكلام المكدس بالكامل
تعمل معظم نماذج SSL للكلام على تحسين ASR ونأمل أن ينجح كل شيء آخر.
تعمل معظم نماذج SSL للكلام على تحسين ASR ونأمل أن ينجح كل شيء آخر. تم تصميم WavLM، من Microsoft، في الاتجاه المعاكس - التدريب المسبق مرة واحدة، القيام بكل شيء: التعرف، والتحقق من المتحدث، والتدوين، والفصل، ومعيار SUPERB الكامل. الحيلة هي انحياز الموضع النسبي المسور في transformer بالإضافة إلى خلط الكلام أثناء التدريب المسبق، مما يجبر النموذج على تعلم تمثيلات مدركة للمتحدث وقوية الضوضاء بدلاً من التمثيلات الصوتية فقط.
وكانت النتيجة اكتساحًا نظيفًا للوحة المتصدرين SUPERB عندما هبطت، مع مكاسب قوية بشكل خاص في المهام غير ASR التي يميل HuBERT وwav2vec 2.0 إلى التقليل من أهميتها. تتناول هذه الجلسة كيف يبدو خلط الكلام فعليًا في وقت التدريب، وسبب أهمية انحياز الموضع للسياقات الأطول، وكيف تم تجميع مجموعة التدريب المسبق التي تبلغ 94 ألف ساعة. إذا سئمت من الحفاظ على برنامج تشفير منفصل لكل مهمة كلامية، فإن WavLM هي واحدة من أقوى الرهانات الأساسية المتوفرة على HuggingFace اليوم - فالغوص العميق يستحق الانتظار.
