[短評] Wav2Seq:使用偽語言預訓練語音到文字編碼器-解碼器模型
像 wav2vec 2.0 這樣的自監督預訓練為我們提供了出色的語音編碼器,但如果你想要一個完整的編碼器-解碼器 ASR 系統,解碼器仍然是從頭開始。
像 wav2vec 2.0 這樣的自監督預訓練為我們提供了出色的語音編碼器,但如果你想要一個完整的編碼器-解碼器 ASR 系統,解碼器仍然是從頭開始。 Wav2Seq 透過發明一種偽語言、從語音特徵派生的離散簇 ID 以及對整個 seq2seq Transformer 進行預訓練以將音訊翻譯成它來解決這個問題。
這篇簡短的評論將 Wav2Seq 配方提煉為重要的部分,如何構建偽令牌,為什麼生成的預訓練任務實際上有助於下游 ASR 和口語 NLU,以及它如何與僅編碼器預訓練方法配合使用。包括對 seq2seq 注意力的快速修正。如果您正在評估低資源語音到文字的預訓練策略,請點選快速版本。
