فهم VALL-E من Microsoft في 3 دقائق (SOTA Zero-shot TTS)
VALL-E هي اللحظة التي توقف فيها TTS عن الظهور مثل انحدار الإشارة وبدأ يبدو مثل نمذجة اللغة، وهذا الشارح السريع يسرع لك الوصول بسرعة.
VALL-E هي اللحظة التي توقف فيها TTS عن الظهور مثل انحدار الإشارة وبدأ يبدو مثل نمذجة اللغة، وهذا الشارح السريع يسرع لك الوصول بسرعة. دربت Microsoft نموذج لغة ترميز عصبي على رموز صوتية منفصلة ينتجها برنامج ترميز جاهز، وزيادة بيانات التدريب إلى 60,000 ساعة من الكلام الإنجليزي، وإعادة صياغة تحويل النص إلى كلام كتنبؤ برمز شرطي التالي. والنتيجة هي نموذج ينسخ متحدثاً غير مرئي من موجه صوتي مدته ثلاث ثواني، بأفضل طبيعية وتشابه مع المتحدث من الناحية الحالية.
القصة الأعمق هي ظهور التعلم في السياق في المجال الصوتي. تحافظ VALL-E على عاطفة المتحدث وحتى البيئة الصوتية للموجه، وهو سلوك لم تتمكن الأنظمة الترتيبية والعصبية TTS الأقدم من مطابقته بهذه الجودة. بالنسبة لأي شخص ينشر استنساخ صوتي أو مزامنة صوتية أو مساعدين مخصصين، هذه هي الورقة التي أعادت رسم الخريطة، وأطلقت موجة codec-LM TTS التي تابعتها. إذا كان لديك ثلاث دقائق وتريد الحدس الأساسي دون قراءة الورقة الكاملة، اضغط على التشغيل.
