W2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self Supervise

Tutorials

W2v-BERT:结合对比学习和掩蔽语言建模进行自监督

当你可以将对比学习和掩蔽语言建模都集成到同一网络时,为什么还要为语音预训练在两者之间做出选择呢?

当你可以将对比学习和掩蔽语言建模都集成到同一网络时,为什么还要为语音预训练在两者之间做出选择呢?来自 Google 的 W2v-BERT 在 BERT 风格的 MLM 模块顶部堆叠了一个 wav2vec 风格的对比模块,并端到端地训练它们,因此对比损失学到的离散码本成为 MLM 头的预测目标——没有离线聚类,没有两阶段管道。

这种单循环设计不仅仅是一个整洁的工程选择。在 Librispeech test-other 上,W2v-BERT 在发布时达到了新的最低 WER,并清晰地推广到 Google 的庞大多语言语音搜索数据,在可比参数计数下超越了 wav2vec 2.0 和 HuBERT。这次讲座分解了两个损失项、为什么联合训练稳定了码本使用,以及该模型在哪里仍然为下游微调留有余地。如果你在评估哪个自监督骨干来构建你的生产 ASR,这个值得花 10 分钟的关注。