Review Microsoft's VALL-E 2 (Achieving Human Parity in Zero-shot TTS)

Tutorials

مراجعة VALL-E 2 من Microsoft (تحقيق التكافؤ البشري في TTS بدون تدريب)

TTS بدون تدريب عبر للتو خطاً يعتقد الكثيرون أنه لا يزال سنوات بعيداً: VALL-E 2 من Microsoft هو أول نموذج لغة ترميز عصبي يحقق التكافؤ البشري على كل من LibriSpeech و VCTK من حيث المتانة والطبيعية والمتكلم

TTS بدون تدريب عبر للتو خطاً يعتقد الكثيرون أنه لا يزال سنوات بعيداً: VALL-E 2 من Microsoft هو أول نموذج لغة ترميز عصبي يحقق التكافؤ البشري على كل من LibriSpeech و VCTK من حيث المتانة والطبيعية وتشابه المتكلم. تقدم هذه المراجعة المفصلة فك تشفير لكيفية وصول الفريق إلى هناك، مع التركيز على اثنين من التعديلات المعمارية البسيطة خادعة التي تصلح بهدوء أكبر أنماط الفشل في VALL-E الأصلي - حلقات فك التشفير الهائمة والإخراج الهش على الجمل الطويلة والمعقدة أو المتكررة التي اعتادت على كسر النموذج.

الحركات الأساسية هي Repetition Aware Sampling، الذي يعيد تشكيل عينة النواة من خلال الشرط على سجل تكرار الرمز لتثبيت فك التشفير وقتل الحلقات اللانهائية، و Grouped Code Modeling، الذي يقسم رموز الترميز إلى مجموعات لتقليل طول التسلسل وتسريع الاستدلال ومعالجة تحديات نمذجة التسلسل الطويل. تمر المراجعة خلال سبب أهمية هذه الأمور لأي شخص يبني TTS الإنتاجي: إخراج بجودة أعلى باستمرار حتى على الجمل التقليدية الصعبة، وتشابه متكلم أقوى، ومسار معقول لتطبيقات إمكانية الوصول مثل استعادة الأصوات للأشخاص الذين يعانون من التصلب الجانبي الضموري أو عسر الكلام. إذا كنت تعمل على codec LMs أو أصوات عصبية أو استنساخ الصوت بدون تدريب، فهذا التفصيل هو المكان الذي تبدأ به قبل الغوص في الورقة.