مراجعة Deepmind's WaveNet لـ TTS/تركيب الصوت (هل يبدو مثل GPT بالنسبة لك؟)
قبل Tacotron، قبل VALL-E، قبل أن تقوم برامج الترميز العصبية بتحويل الصوت إلى رموز مميزة، كانت WaveNet الخاصة بـ DeepMind هي الورقة التي أظهرت أن الشبكات العصبية يمكنها إنشاء أشكال موجية صوتية خام عينة تلو الأخرى وتغلب على كل معلمة و
قبل Tacotron، قبل VALL-E، قبل أن تقوم برامج الترميز العصبية بتحويل الصوت إلى رموز مميزة، كانت WaveNet الخاصة بـ DeepMind هي الورقة التي أظهرت أن الشبكات العصبية يمكنها إنشاء أشكال موجية صوتية خام عينة تلو الأخرى والتغلب على كل نظام TTS البارامترى والتسلسلي على الطبيعة. انظر إليها الآن، مع ارتداء نظارات على شكل GPT، والتشابه غريب: نموذج انحدار ذاتي احتمالي كامل يكيف كل عينة على جميع العينات السابقة - نموذج لغة للصوت، قبل خمس سنوات من أن يكون LLMs مصطلحًا مألوفًا.
تستعرض المراجعة البنية التي جعلتها تعمل عند 16 كيلو هرتز: التلافيف السببية المتوسعة لتنمية المجال المستقبلي بشكل كبير، والتنشيط المسور، والاتصالات المتبقية والتخطي. ويغطي أيضًا ما أظهره WaveNet فيما بعد TTS - تكييف السماعات لتبادل الأصوات، وتوليد الموسيقى كمنتج ثانوي، وحتى التعرف على الصوت التنافسي كنموذج تمييزي. إذا كنت تريد أن ترى أين بدأ الذكاء الاصطناعي المولد للكلام الحديث بالفعل، ولماذا يستمر نموذج الانحدار التلقائي للرموز المميزة فوق الصوت في العودة إلى أنظمة TTS الأحدث، فإن هذا المعرض الاستعادي يعد أساسًا رائعًا.
