[详细论文解读] Zipformer:自动语音识别的更快更优编码器
Conformer多年来一直是默认的ASR编码器,但k2/icefall团队的Zipformer在LibriSpeech、Aishell-1和WenetSpeech上悄悄夺得WER冠军,同时更快更轻。
Conformer多年来一直是默认的ASR编码器,但k2/icefall团队的Zipformer在LibriSpeech、Aishell-1和WenetSpeech上悄悄夺得WER冠军,同时更快更轻。这次详细的论文解读阐述了他们的具体做法:一个U-Net风格的编码器,将中间堆栈下采样到更低的帧率;一个重组的块,在子模块间重用注意力权重;LayerNorm的BiasNorm变体,保留长度信息;以及两个新的激活函数(SwooshR和SwooshL),它们的性能超越了Swish。
讲解不止于架构。Zipformer随附ScaledAdam,一个新的优化器,它对每个张量重新缩放更新并显式学习参数规模,在相同的方案下比Adam收敛更快。每个设计选择都附带支持它的消融实验,这样你可以看到哪些技巧可以泛化,哪些与U-Net拓扑紧密相关。如果你在生产中维护ASR编码器,或你好奇为什么Next-gen Kaldi能在没有巨大计算预算的情况下不断创造最先进成果,点击播放吧——这是一次罕见的论文解读,深入工程细节,而不仅仅是摘要。
