[مراجعة قصيرة] Wav2Seq: نماذج مشفر-فاك مدرب مسبقاً للكلام إلى نص باستخدام لغات وهمية
وفر التدريب المسبق غير الخاضع للإشراف مثل wav2vec 2.0 مشفرات كلام ممتازة لنا، لكن بالنسبة لنظام ASR كامل مشفر-فاك، كان الفاك لا يزال يبدأ من الصفر.
وفر التدريب المسبق غير الخاضع للإشراف مثل wav2vec 2.0 مشفرات كلام ممتازة لنا، لكن بالنسبة لنظام ASR كامل مشفر-فاك، كان الفاك لا يزال يبدأ من الصفر. يصلح Wav2Seq ذلك بابتكار لغة وهمية، معرّفات مجموعة منفصلة مستمدة من ميزات الكلام، والتدريب المسبق لـ Transformer seq2seq كامل لترجمة الصوت إليها.
تركز هذه المراجعة القصيرة على أساسيات وصفة Wav2Seq: كيفية بناء الرموز الوهمية، لماذا تساعد مهمة التدريب المسبق الناتجة فعلاً على ASR اللاحق و NLU المنطوق، وكيف تتماشى مع نهج التدريب المسبق الذي يقتصر على المشفر فقط. يتم تضمين تصحيح سريع على انتباه seq2seq. اضغط على التشغيل للحصول على النسخة السريعة إذا كنت تقيم استراتيجيات التدريب المسبق لكلام إلى نص محدود الموارد.
