像三胞胎一樣的俄羅斯花滑運動員:Kullback-Leibler 散度能用來區別他們嗎?
說話者自適應是那種 ASR 問題之一,聽起來已經解決,直到你實際嘗試在不破壞編碼器苦心獲得的聲學表示的情況下自適應序列到序列模型。
說話者自適應是那種 ASR 問題之一,聽起來已經解決,直到你實際嘗試在不破壞編碼器苦心獲得的聲學表示的情況下自適應序列到序列模型。這個演講使用了記憶猶新的近乎相同的俄羅斯花滑運動員的框架來提問 KL 散度是否可以區分非常相似的說話者分佈,並詳細介紹了「聆聽、注意、拼寫和自適應」:一個說話者自適應序列到序列 ASR 架構,它保持基礎模型完整,同時學習一個輕量級的每說話者組件。
期待仔細查看 KL 正則化如何防止自適應期間的災難性漂移、自適應數據預算如何與 WER 增益權衡,以及為什麼 LAS 風格的注意力編碼器在自適應下的行為與混合 HMM 系統不同。對於任何構建個性化語音界面、語音克隆堆棧或具有每用戶聲學概況的聽寫產品的人來說,此處的想法仍然直接轉化為 Conformer 和基於轉換器的系統。如果說話者自適應在你的 ASR 堆棧中不僅僅是好奇心,就點擊播放。
