SNRi Target Training for Joint Speech Enhancement and Recognition

Tutorials

用於語音增強和識別聯合訓練的SNRi目標訓練

語音增強和ASR的聯合訓練聽起來很簡單——只需通過去噪器反向傳播識別損失——但實踐中很混亂,因為激進的去噪往往會扭曲聲學模型所依賴的特徵

語音增強和ASR的聯合訓練聽起來很簡單——只需通過去噪器反向傳播識別損失——但在實踐中卻很混亂,因為激進的去噪往往會扭曲聲學模型所依賴的特徵。這篇NTT論文提出了一個更簡潔的目標:不是增強到「乾淨」,而是增強到下遊識別器實際偏好的目標信噪比,並讓模型學習在噪聲-失真權衡中應該停留的位置。

SNRi目標按話語估計,用作增強網絡的明確控制信號,因此前端停止過度處理簡單部分,停止欠處理困難部分。本次演講介紹了如何派生目標、如何將其集成到標準增強架構,以及相對於級聯和標準聯合訓練基線在CHiME類基準上的改進。如果你正在將ASR部署到嘈雜的真實環境中——汽車、呼叫中心、可穿戴設備——這是一個微妙但強大的技巧,值得添加到你的管道中。