WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing

Tutorials

WavLM:用於全端語音處理的大規模自監督預訓練

大多數語音 SSL 模型針對 ASR 進行了最佳化,並希望其他一切順利。

大多數語音 SSL 模型針對 ASR 進行了最佳化,並希望其他一切順利。來自 Microsoft 的 WavLM 是以相反的方式構建的 - 預訓練一次,完成所有操作:識別、說話人驗證、二值化、分離、完整的 SUPERB 基準測試。訣竅是 transformer 中的門控相對位置偏差加上預訓練期間的話語混合,這迫使模型學習說話者感知和抗噪音表示,而不僅僅是語音表示。

結果是,當它登陸時,它橫掃了 SUPERB 排行榜,在 HuBERT 和 wav2vec 2.0 往往服務不足的非 ASR 任務上取得了特別強勁的成績。本課程將介紹訓練時的話語混合實際是什麼樣子、為什麼位置偏差對於較長的上下文很重要,以及如何組裝 94,000 小時的預訓練語料庫。如果您厭倦了為每個下游語音任務維護單獨的編碼器,WavLM 是當今 HuggingFace 上最強大的單骨幹賭注之一 - 值得深入研究。