Google 研究人員對端對端語音辨識的深入分析,第 1 部分:概述和建模
十年的深度學習將 ASR 詞錯誤率相對降低了 50% 多,並在此過程中使經典 HMM 管道看起來像文物。
十年的深度學習將 ASR 詞錯誤率相對降低了 50% 多,並在此過程中使經典 HMM 管道看起來像文物。這是 Prabhavalkar、Hori、Sainath、Schluter 和 Watanabe 的端到端 ASR 調查第 1 部分分解(一個基本上就是該領域的陣容),建立了 E2E ASR 模型的分類法,並將其與大多數在職工程師成長時接觸的 HMM 遺產進行對比。這是一個框架性的集數,使調查的其餘部分變得清晰。
概述的重點是建模——CTC、基於注意力的編碼器-解碼器和轉導器變種在歸納偏差上如何不同,它們在降低對 ASR 領域特定專業知識的依賴方面為您帶來什麼好處,以及為什麼行業圍繞能夠更一致地從數據中學習的全神經堆棧進行了整合。它為後來關於訓練、解碼、外部語言模型集成、部署、性能分析和該領域未來方向的部分奠定了基礎。如果您正在加入現代 ASR 團隊或試圖在 Kaldi 風格的混合系統和 Whisper、NeMo、ESPnet 或基於轉導器的識別器之類的東西之間做出決定,這是在踏足該領域之前您想要的地圖。
