[مراجعة طويلة] Wav2Seq: نماذج فك ترميز وتشفير الكلام إلى نص باستخدام اللغات الزائفة
ركزت معظم التدريبات المسبقة على الكلام على جانب التشفير، wav2vec، HuBERT، WavLM، لكن التسلسل إلى التسلسل ASR يحتاج إلى وحدة فك ترميز مُدربة مسبقًا أيضًا.
ركزت معظم التدريبات المسبقة على الكلام على جانب التشفير، wav2vec، HuBERT، WavLM، لكن التسلسل إلى التسلسل ASR يحتاج إلى وحدة فك ترميز مُدربة مسبقًا أيضًا. يقوم Wav2Seq بسد هذه الفجوة بخدعة ذكية: تجميع تمثيلات الكلام في رموز زائفة منفصلة، ثم التعامل مع تلك الرموز المميزة على أنها "لغة زائفة" اصطناعية والتدريب المسبق لجهاز فك ترميز وتشفير كامل Transformer لترجمة الكلام إليها.
تتجول هذه المراجعة الطويلة عبر خط أنابيب Wav2Seq بالتفصيل، وكيفية إنشاء اللغة الزائفة، ولماذا التعامل معها كهدف ترجمة حقيقي يعلم وحدة فك التشفير شيئًا مفيدًا، وكيف ينتقل النموذج المُدرب مسبقًا إلى ASR ومهام فهم اللغة المنطوقة. تم تضمين تصحيح حول الاهتمام في وحدة seq2seq. إذا كنت تعمل على ASR منخفض الموارد، أو تحويل الكلام إلى نص متتالي، أو تحاول الاستفادة بشكل أكبر من التدريب المسبق الخاضع للإشراف الذاتي بما يتجاوز جهاز التشفير، فإن التعمق في كل خيار تصميم يستحق الفهم.
