[Long Review] CLAS: Deep context: end-to-end contextual speech recognition

Tutorials

[長篇評論] CLAS:深度上下文:端到端語境化語音識別

任何運送過 ASR 產品的人都知道專有名詞的困難:聯絡人名稱、歌曲標題、藥物名稱、晦澀地名。

任何運送過 ASR 產品的人都知道專有名詞的困難:聯絡人名稱、歌曲標題、藥物名稱、晦澀地名。CLAS,或語境化聽-注意-拼寫,是 Google 的答案,用於將該上下文直接注入端到端語音識別器。CLAS 不是在事後偏向波束搜尋,而是學習對偏向短語列表的注意機制,讓模型可以在解碼時依靠使用者特定的詞彙,無需重新訓練。

這篇長篇評論分解架構、使偏向注意對分心者穩健的訓練技巧,以及在現實語音助手任務上的 WER 勝利。如果你正在構建裝置上 ASR、聽寫應用或個性化重要的語音介面,CLAS 即使多年後仍是基礎讀物,其想法不斷出現在現代 RNN-T 和 CTC 語境化偏向工作中。如果語境化偏向在你的 ASR 路線圖上,請打開筆記本並跟隨。