[長評論] Wav2Seq:使用偽語言預訓練語音轉文本編碼器-解碼器模型
大多數語音預訓練集中在編碼器端,wav2vec、HuBERT、WavLM,但序列到序列ASR也需要預訓練的解碼器。
大多數語音預訓練集中在編碼器端,wav2vec、HuBERT、WavLM,但序列到序列ASR也需要預訓練的解碼器。Wav2Seq通過一個巧妙的技巧彌補了這一差距:將語音表示聚類為離散的偽令牌,然後將這些令牌視為合成的「偽語言」,並預訓練完整的編碼器-解碼器Transformer將語音翻譯為它。
這篇長形式評論詳細講解了Wav2Seq管道、偽語言的構造方式、為什麼將其視為真實翻譯目標可以教解碼器有用的東西,以及預訓練模型如何轉移到下游ASR和語音語言理解任務。包括了關於seq2seq模塊中注意力的更正。如果您從事低資源ASR、級聯語音轉文本或試圖從超越編碼器的自監督預訓練中挖掘更多價值,深度探討會講解每個值得理解的設計選擇。
