[장문 리뷰] Axial Attention in Multidimensional Transformers
이미지 또는 비디오에 대한 완전한 self-attention은 비용이 과도합니다. 이차 증가 없이 Transformer의 표현력을 유지하려면?
이미지 또는 비디오에 대한 완전한 self-attention은 비용이 과도합니다. 이차 증가 없이 Transformer의 표현력을 유지하려면? Ho, Kalchbrenner, Weissenborn, 그리고 Salimans은 axial attention을 제안합니다: 한 번에 텐서의 한 축만 주목하고, 축들을 순차적으로 적용하면, 훨씬 적은 계산으로 전체 맥락을 보존합니다.
Axial Transformers 논문의 이 장문 리뷰는 아키텍처를 처음부터 끝까지 설명하고, axial attention 계층이 어떻게 구성되는지, 반병렬 디코딩 구조가 독립성 가정 없이 실제로 어떻게 작동하는지, 그리고 모델이 ImageNet-32, ImageNet-64, BAIR Robotic Pushing에서 최첨단 결과를 얻는 방법을 안내합니다. 음성 엔지니어들이 주목해야 할 점: 같은 트릭은 spectrogram-time-frequency 격자를 포함한 모든 고차원 텐서에 적용되며, 논문은 오픈소스로 공개되어 있습니다. audio 또는 multimodal 작업을 위한 효율적인 attention을 고려 중이라면, 심층 분석은 모든 설계 선택을 안내합니다.
