用於多語言 ASR 的聯合無監督和有監督訓練
預訓練然後微調已成為多語言 ASR 的默認做法,但它留下了很多東西:這兩個階段不共享損失,有監督階段可以悄悄地洗掉有用的自監督結構
預訓練然後微調已成為多語言 ASR 的默認做法,但它留下了很多東西:這兩個階段不共享損失,有監督階段可以悄悄地洗掉有用的自監督結構。Google 的 JUST 框架將它們融合成一個單一的聯合目標——對比損失、掩蓋預測損失和 RNN-T 有監督損失都通過一個共享編碼器同時反向傳播。
在 42 語言的 Multilingual Librispeech 基準上,JUST 優於級聯預訓練管道和純有監督基線,在標記數據是瓶頸的低資源語言上尤其有強勁的收益。這次談話解釋了三個損失如何平衡、為什麼聯合訓練在腳本和音韻上更好地推廣、以及該方法在何處仍為特定語言的適配器留下了空間。如果您正在處理多語言 ASR 堆棧並在分階段訓練運行上耗費週期,這個一鍋食譜值得認真考慮。
