[مراجعة طويلة] نقل التعلم من التحقق من المتحدث إلى تحويل النص إلى كلام متعدد المتحدثين
هذه هي الورقة التي جعلت استنساخ الصوت بدون أمثلة عملياً: قم بتدريب مشفر المتحدث على مهمة التحقق التمييزية باستخدام آلاف الأصوات الضاخة والخالية من النصوص، ثم أدخل هذه التضمينات في Tacotron 2
هذه هي الورقة التي جعلت استنساخ الصوت بدون أمثلة عملياً: قم بتدريب مشفر المتحدث على مهمة التحقق التمييزية باستخدام آلاف الأصوات الضاخة والخالية من النصوص، ثم أدخل هذه التضمينات في محلل Tacotron 2 ومحلل الصوت WaveNet. النتيجة هي نظام TTS يمكنه محاكاة متحدث جديد من بضع ثوان من الصوت المرجعي، حتى المتحدثين الذين لم يكونوا موجودين أثناء التدريب.
تشرح هذه المراجعة الطويلة لعمل Jia وزملاؤه من Google جميع الوحدات الثلاث بالتفصيل: مشفر المتحدث المدرب على هدف التحقق، محلل طيف الميل من تسلسل إلى تسلسل المشروط على التضمين، ومحلل الصوت الانحداري WaveNet. كما أنها تشرح الدراسات الاستئصالية التي تحدد مقدار تنوع المتحدثين المطلوب في المشفر للتعميم، بالإضافة إلى النتيجة المفاجئة بأن التضمينات المأخوذة عشوائياً تنتج أصواتاً جديدة متماسكة. إذا كنت تبني أي شيء في مجال استنساخ الصوت أو تخصيص TTS أو تضمين المتحدث، فهذه الورقة ضرورية للقراءة والمراجعة المتعمقة توضح كل جزء.
