Olewave's most detailed illustration of RNN-T: Sequence Transduction with Recurrent Neural Networks

Tutorials

‌Olewave الرسم التوضيحي الأكثر تفصيلاً لـ RNN-T: نقل التسلسل مع الشبكات العصبية المتكررة

تعد ورقة RNN-T الخاصة بـ Alex Graves هي الجد الهادئ لكل أنظمة ASR المتدفقة التي يتم شحنها اليوم تقريبًا، بدءًا من أداة التعرف على الجهاز من Google وحتى عدد لا يحصى من مجموعات Transformerات الطاقة مفتوحة المصدر في NeMo وESPnet وما بعده.

تعد ورقة RNN-T الخاصة بـ Alex Graves هي الجد الهادئ لكل أنظمة ASR المتدفقة التي يتم شحنها اليوم تقريبًا، بدءًا من أداة التعرف على الجهاز من Google وحتى عدد لا يحصى من مجموعات Transformerات الطاقة مفتوحة المصدر في NeMo وESPnet وما بعده. تعتبر هذه الإرشادات التفصيلية نفسها الرسم التوضيحي الأكثر تفصيلاً لنقل التسلسل مع الشبكات العصبية المتكررة، وهي تكتسب التسمية عن طريق تفكيك كل جزء من النموذج الذي تتغاضى عنه الملخصات الأخرى، بدءًا من اشتقاق الخسارة إلى الآثار العملية لشبكة المحاذاة.

توقع جولة دقيقة حول بنية أداة التشفير والتنبؤ والوصلة، وفقدان Transformer الطاقة وشبكة محاذاته، والرمز الفارغ ودوره في توقيت الإخراج، ولماذا يحل RNN-T مشكلة المحاذاة التي لا تستطيع شبكات RNN النقية التعامل معها بمفردها لمهام مثل التعرف على الكلام، والترجمة الآلية، والتنبؤ ببنية البروتين الثانوية، وتحويل النص إلى كلام. تؤدي نتائج صوت TIMIT إلى ترسيخ النظرية في شيء ملموس، وتقوم الرسوم البيانية بالعبء الثقيل حيث ستفقدك المعادلات وحدها. إذا سبق لك أن حاولت تنفيذ RNN-T من الصفر، وقمت بتصحيح أخطاء فقدان Transformer الطاقة وتمنيت أن يقوم شخص ما برسم الشبكة مرة أخرى، أو كنت بحاجة إلى أن تشرح لزميل في الفريق لماذا لا يكون Transformer الطاقة مجرد CTC، فإن هذا الغوص العميق يستحق إيقاف البناء مؤقتًا من أجله.