تحسين دقة التعرف على الكلام لـ POI المحلي باستخدام نماذج جغرافية
اطلب من مساعد صوتي نقلك إلى مطعم محلي صغير وستجد بسرعة حيث ينهار ASR — أسماء POI ذات الذيل الطويل التي لم تظهر أبداً في مجموعة تدريب LM.
XLS-R: تعلم تمثيلات الكلام الإشرافي الذاتي عبر اللغات على نطاق واسع
إلى أي حد يمكنك دفع التدريب المسبق للكلام عبر اللغات قبل نضوب الموارد؟
قوانين التوسع لنماذج اللغة العصبية
قبل أن يجعل GPT-3 التوسع يبدو حتمياً، جعلت هذه الورقة البحثية من OpenAI التنبؤ به ممكناً.
UniSpeech-SAT : التعلم العام لتمثيل الكلام مع التدريب المسبق الموجه للمتحدث
نماذج الكلام ذاتية الإشراف تميل إلى تعلم المحتوى الصوتي بشكل جميل وهوية المتحدث كملاحظة جانبية — وهذا مناسب لـ ASR لكنه سيء جداً للتحقق من المتحدث أو فصل المتحد…
RefineGAN: توليد الموجة الصوتية عالمياً بشكل أفضل من الحقيقة الأساسية بدقة عالية في الارتفاع و
"أفضل من الحقيقة الأساسية" هو نوع الادعاء الذي يجعلك إما تدير عينيك أو تضغط على التشغيل.
تدريب الهدف SNRi للتحسين المشترك للكلام والتعرف عليه
يبدو التدريب المشترك لتحسين الكلام و ASR واضحاً — فقط قم بنشر خسارة التعرف عبر مزيل الضوضاء — لكن في الممارسة العملية فهو فوضوي، لأن إزالة الضوضاء العدوانية غال…
BigSSL: استكشاف حدود التعلم شبه الموجه واسع النطاق للتعرف التلقائي على الكلام
ماذا يحدث عندما تأخذ وصفة ASR شبه الموجهة التي تغلبت على أحدث التقنيات عند 100M معاملة وتستمر في التوسع؟
