[Short Review] Wav2Seq: Pre-training Speech-to-Text Encoder-Decoder Models Using Pseudo Languages

Tutorials

[短评] Wav2Seq:使用伪语言预训练语音到文本编码器-解码器模型

像 wav2vec 2.0 这样的自监督预训练为我们提供了出色的语音编码器,但如果你想要一个完整的编码器-解码器 ASR 系统,解码器仍然是从头开始。

像 wav2vec 2.0 这样的自监督预训练为我们提供了出色的语音编码器,但如果你想要一个完整的编码器-解码器 ASR 系统,解码器仍然是从头开始。 Wav2Seq 通过发明一种伪语言、从语音特征派生的离散簇 ID 以及对整个 seq2seq Transformer 进行预训练以将音频翻译成它来解决这个问题。

这篇简短的评论将 Wav2Seq 配方提炼为重要的部分,如何构建伪令牌,为什么生成的预训练任务实际上有助于下游 ASR 和口语 NLU,以及它如何与仅编码器预训练方法配合使用。包括对 seq2seq 注意力的快速修正。如果您正在评估低资源语音到文本的预训练策略,请点击快速版本。