Google研究人員對端到端語音辨識的深入分析,第1部分:概述與建模
十年的深度學習將ASR詞錯誤率相對降低超過50%,同時使經典HMM管道看起來像古董。
十年的深度學習將ASR詞錯誤率相對降低超過50%,同時使經典HMM管道看起來像古董。Prabhavalkar、Hori、Sainath、Schluter和Watanabe(基本上就是該領域)的端到端ASR調查的第1部分分解建立了E2E ASR模型的分類法,並將其與大多數工程師成長過程中接觸的HMM遺產進行比較。這是使調查其餘部分順利進行的框架集。
概述重點是建模——CTC、基於注意力的編碼器-解碼器和轉換器變體在歸納偏差方面的差異、它們如何減少對ASR特定領域專業知識的依賴,以及為什麼產業圍繞學習數據更一致的全神經棧進行整合。它為稍後關於訓練、解碼、外部語言模型整合、部署、性能分析和該領域未來方向的部分奠定了基礎。如果您正在加入現代ASR團隊或試圖在Kaldi式混合和Whisper、NeMo、ESPnet或基於轉換器的識別器之類的東西之間做出決定,這是您在探索前想要的地圖。
