[长评] Wav2Seq:使用伪语言预训练语音到文本编码器-解码器模型
大多数语音预训练集中在编码器侧,wav2vec、HuBERT、WavLM,但序列到序列ASR也需要预训练的解码器。
大多数语音预训练集中在编码器侧,wav2vec、HuBERT、WavLM,但序列到序列ASR也需要预训练的解码器。Wav2Seq通过一个聪明的技巧弥补了这个差距:将语音表示聚类为离散的伪令牌,然后将这些令牌视为合成的"伪语言",并预训练完整的编码器-解码器Transformer将语音翻译为它。
这篇长篇评论详细介绍了Wav2Seq管道、伪语言是如何构建的、为什么将其视为真实翻译目标可以教解码器一些有用的东西,以及预训练模型如何迁移到下游ASR和口语理解任务。包括对seq2seq模块中注意力的更正。如果您正在从事低资源ASR、级联语音到文本或试图从超越编码器的自监督预训练中获得更多收益的工作,深度分析涵盖了每个值得理解的设计选择。
