SNRi Target Training for Joint Speech Enhancement and Recognition

Tutorials

تدريب الهدف SNRi للتحسين المشترك للكلام والتعرف عليه

يبدو التدريب المشترك لتحسين الكلام و ASR واضحاً — فقط قم بنشر خسارة التعرف عبر مزيل الضوضاء — لكن في الممارسة العملية فهو فوضوي، لأن إزالة الضوضاء العدوانية غالباً ما تشوه الميزات التي يعتمد عليها نموذج صوتي

يبدو التدريب المشترك لتحسين الكلام و ASR واضحاً — فقط قم بنشر خسارة التعرف عبر مزيل الضوضاء — لكن في الممارسة العملية فهو فوضوي، لأن إزالة الضوضاء العدوانية غالباً ما تشوه الميزات التي يعتمد عليها نموذج صوتي. تقترح ورقة NTT هذه هدفاً أنظف: بدلاً من التحسين إلى "نظيف"، حسّن إلى نسبة إشارة إلى ضوضاء مستهدفة يفضلها جهاز التعرف اللاحق فعلاً، واسمح للنموذج بتعلم مكان الجلوس في المقايضة بين الضوضاء والتشويه.

يتم تقدير هدف SNRi لكل ملفوظ ويُستخدم كإشارة تحكم صريحة لشبكة التحسين، لذا تتوقف الواجهة الأمامية عن معالجة المقاطع السهلة بشكل مفرط وتتوقف عن معالجة الأقسام الصعبة بشكل ناقص. يغطي الشرح كيفية اشتقاق الهدف، وكيفية توصيله بمعماريات التحسين القياسية، والمكاسب المرجعية بأسلوب CHiME التي يحققها على كل من خطوط الأساس المتسلسلة والمشتركة للتدريب العادي. إذا كنت تشحن ASR في بيئات حقيقية صاخبة — السيارات ومراكز الاستدعاء والملابس القابلة للارتداء — فهذه خدعة دقيقة لكنها قوية لإضافتها إلى خط الأنابيب الخاص بك.