مراجعة متعمقة لـ VALL-E: نماذج ترميز اللغة العصبية هي مركبات نص إلى كلام بدون عينة
بدت فكرة نقل TTS بدون عينة من مقطع مرجعي مدته ثلاث ثواني بعيدة المنال حتى وصلت VALL-E، وتفكك هذه المراجعة المتعمقة بالضبط كيفية تحقيق Microsoft لذلك.
بدت فكرة نقل TTS بدون عينة من مقطع مرجعي مدته ثلاث ثواني بعيدة المنال حتى وصلت VALL-E، وتفكك هذه المراجعة المتعمقة بالضبط كيفية تحقيق Microsoft لذلك. يعامل النموذج برنامج ترميز صوتي عصبي جاهز كمحلل رموز، ثم يدرب نموذج لغة للتنبؤ برموز صوتية مشروطة بالنص والموجه القصير للمتحدث. إعادة صياغة التركيب كتنبؤ برمز شرطي التالي بدلاً من انحدار الإشارة المستمرة هي المحور المفاهيمي الذي يفتح تكيف المتحدث في السياق.
تمر المراجعة عبر مخطط فك التشفير ثنائي المرحلة الانحداري التلقائي وغير الانحداري، ومجموعة بيانات التدريب المستخرجة من LibriLight بحجم 60,000 ساعة، والتقييمات التي تظهر VALL-E متفوقة على أفضل ما يمكن تحقيقه سابقاً من حيث الطبيعية والتشابه مع المتحدث. كما يغطي السلوك الناشئ المثير للدهشة: النموذج ينقل عاطفة المتحدث والبيئة الصوتية للتسجيل من الموجه إلى المخرجات. بالنسبة لمهندسي TTS وشركات استنساخ الصوت وأي شخص يقيّم approaches من codec-LM ضد بدائل diffusion أو flow-matching، هذه هي المراجعة المرجعية. أضفها إلى قائمة الانتظار عندما يكون لديك وقت للجولة المعمارية الكاملة.
