WavLM:用于全栈语音处理的大规模自监督预训练
大多数语音 SSL 模型针对 ASR 进行了优化,并希望其他一切顺利。
大多数语音 SSL 模型针对 ASR 进行了优化,并希望其他一切顺利。来自 Microsoft 的 WavLM 是以相反的方式构建的 - 预训练一次,完成所有操作:识别、说话人验证、二值化、分离、完整的 SUPERB 基准测试。诀窍是 transformer 中的门控相对位置偏差加上预训练期间的话语混合,这迫使模型学习说话者感知和抗噪声表示,而不仅仅是语音表示。
结果是,当它登陆时,它横扫了 SUPERB 排行榜,在 HuBERT 和 wav2vec 2.0 往往服务不足的非 ASR 任务上取得了特别强劲的成绩。本课程将介绍训练时的话语混合实际是什么样子、为什么位置偏差对于较长的上下文很重要,以及如何组装 94,000 小时的预训练语料库。如果您厌倦了为每个下游语音任务维护一个单独的编码器,WavLM 是当今 HuggingFace 上最强大的单骨干赌注之一 - 值得深入研究。
