[Long Review] CLAS: Deep context: end-to-end contextual speech recognition

Tutorials

[长篇评论] CLAS:深度上下文:端到端的上下文语音识别

任何发货过ASR产品的人都知道专有名词的痛苦:联系人名称、歌曲标题、药物名称、不知名的地名。

任何发货过ASR产品的人都知道专有名词的痛苦:联系人名称、歌曲标题、药物名称、不知名的地名。CLAS(即Contextual Listen-Attend-Spell)是Google用于将该上下文直接注入端到端语音识别器的解决方案。CLAS不是在事后对束搜索进行偏置,而是学习了对偏置短语列表的注意机制,因此模型可以在解码时依靠用户特定的词汇表,而无需重新训练。

这篇长篇评论分解了架构、使偏置注意力对干扰因素具有鲁棒性的训练技巧,以及在现实语音助手任务上的WER改进。如果你正在构建设备上ASR、听写应用或个性化很重要的语音界面,CLAS仍然是一篇基础阅读材料,即使多年后,其想法仍在现代RNN-T和CTC上下文偏置工作中出现。如果上下文偏置在你的ASR路线图上,打开笔记本并跟随阅读。