HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units

Tutorials

هوبيرت: تعلم تمثيل الكلام تحت الإشراف الذاتي عن طريق التنبؤ المقنع للوحدات المخفية

غير wav2vec 2.0 قواعد اللعبة من خلال الإشراف الذاتي التبايني، لكن HuBERT طرح سؤالًا أكثر وضوحًا: ماذا لو تخطينا الخدعة التباينية تمامًا وقمنا فقط بالتنبؤ المقنع على طراز BERT بشأن الكلام؟

غير wav2vec 2.0 قواعد اللعبة من خلال الإشراف الذاتي التبايني، لكن HuBERT طرح سؤالًا أكثر وضوحًا: ماذا لو تخطينا الخدعة التباينية تمامًا وقمنا فقط بالتنبؤ المقنع على طراز BERT بشأن الكلام؟ المشكلة هي أن الصوت لا يحتوي على مفردات طبيعية، لذا يقوم HuBERT بتمهيد مفرداته الخاصة - تجميع MFCCs أولاً، ثم إعادة تجميع الحالات المخفية الخاصة بالنموذج بشكل متكرر - وتدريب transformer على التنبؤ بتلك الملصقات الزائفة على الإطارات المقنعة.

تعتبر النتيجة هدفًا أنظف، وفي Librispeech وLibri-light، النتائج تتطابق أو تتفوق على wav2vec 2.0 في كل مقياس نموذج من Base إلى X-Large. هذا الغوص العميق من Meta AI يسير عبر حلقة التمهيد k-means، ولماذا تظهر الوحدات الصوتية من التكرار، وكيف ينتقل نفس التدريب المسبق بشكل نظيف إلى ASR، ومعرف السماعة، والمهام العاطفية. أصبحت HuBERT منذ ذلك الحين إحدى نقاط البداية الافتراضية في HuggingFace لأي شخص يقوم بأعمال تمثيل الكلام، لذلك إذا كنت تختار برنامج تشفير لمشروع ASR أو SLU التالي، فإن قضاء بضع دقائق في الحدس هنا سيوفر لك ساعات من تخمين المعلمات الفائقة لاحقًا.