W2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self Supervise

Tutorials

W2v-BERT: الجمع بين التعلم المتباين ونمذجة اللغة المقنعة للإشراف الذاتي

لماذا تختار بين التعلم المتباين ونمذجة اللغة المقنعة للتدريب المسبق على الكلام عندما يمكنك توصيل كليهما بنفس الشبكة؟

لماذا تختار بين التعلم المتباين ونمذجة اللغة المقنعة للتدريب المسبق على الكلام عندما يمكنك توصيل كليهما بنفس الشبكة؟ يقوم W2v-BERT، خارج Google، بتكديس وحدة نمطية متباينة على نمط wav2vec أعلى وحدة الامتيازات والرهونات البحرية على طراز BERT وتدريبها من البداية إلى النهاية، وبالتالي يصبح كتاب الشفرات المنفصل الذي تم تعلمه عن طريق الخسارة المتباينة هدف التنبؤ لرأس الامتيازات والرهونات البحرية - لا توجد مجموعات غير متصلة بالإنترنت، ولا يوجد خط أنابيب من مرحلتين.

لقد تبين أن هذا التصميم ذو الحلقة الواحدة هو أكثر من مجرد خيار هندسي مرتب. في الاختبار الآخر Librispeech، وصل W2v-BERT إلى مستوى منخفض جديد WER في وقت النشر وتم تعميمه بشكل واضح على بيانات البحث الصوتي الضخمة متعددة اللغات من Google، متفوقًا على wav2vec 2.0 وHuBERT في أعداد معلمات قابلة للمقارنة. يشرح الحديث مصطلحي الخسارة، ولماذا يعمل التدريب المشترك على استقرار استخدام دفتر الرموز، وحيث لا يزال النموذج يترك مجالًا للضبط الدقيق. إذا كنت تقوم بتقييم العمود الفقري الخاضع للإشراف الذاتي لبناء إنتاجك ASR عليه، فإن هذا العمود يستحق 10 دقائق من اهتمامك.