[短评] 多维Transformer中的Axial Attention
Axial Attention是使Transformer在高维数据上保持可处理性的优雅想法之一:你不是一次对所有像素或所有时间-频率箱进行注意力计算,而是一次沿一个轴进行。
Axial Attention是使Transformer在高维数据上保持可处理性的优雅想法之一:你不是一次对所有像素或所有时间-频率箱进行注意力计算,而是一次沿一个轴进行。实现简单,与标准深度学习框架兼容良好,在ImageNet-32、ImageNet-64和BAIR Robotic Pushing上仍然达到最先进水平。
这篇Ho et al.的短评论在一篇文章中讲解了Axial Transformers的核心机制、层如何在张量维度上分解注意力计算,以及为什么半并行解码结构在保持采样速度的同时不放弃联合分布的表达能力。如果你在考虑用于频谱建模、音视频融合或任何导致GPU内存爆炸的语音任务的高效注意力变体,这是有用的背景。在看完整论文之前先快速浏览一下。
