W2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self Supervise

Tutorials

W2v-BERT:結合對比學習和掩蓋語言建模進行自監督

為什麼在語音預訓練中要在對比學習和掩蓋語言建模之間選擇,當您可以將兩者連接到同一個網絡中時?

為什麼在語音預訓練中要在對比學習和掩蓋語言建模之間選擇,當您可以將兩者連接到同一個網絡中時?W2v-BERT 來自 Google,將 wav2vec 風格的對比模塊堆疊在 BERT 風格的 MLM 模塊上方,並端到端地訓練它們,因此由對比損失學習的離散碼本成為 MLM 頭部的預測目標——沒有離線聚類,沒有兩階段管道。

這種單環設計原來不止是一個整潔的工程選擇。在 Librispeech test-other 上,W2v-BERT 在發表時達到了新的最低 WER,並乾淨地推廣到 Google 龐大的多語言語音搜索數據,在可比參數計數上超越了 wav2vec 2.0 和 HuBERT。這次談話分解了兩個損失項、為什麼聯合訓練穩定了碼本使用、以及模型在何處仍為下游微調留下了空間。如果您正在評估在哪個自監督骨幹上構建您的生產 ASR,這個一鍋食譜值得認真考慮。