[Olewave의 리뷰] Branchformer: Parallel MLP-Attention Architectures, and E-Branchformer
Conformer는 수년간 최고의 ASR 인코더였지만, Branchformer와 그 후속작인 E-Branchformer는 순차적 conv-plus-attention이 유일한 경로가 아니라는 설득력 있는 주장을 제시합니다.
Conformer은 수년 동안 이기기 어려운 ASR 인코더였지만, Branchformer와 그 후속 E-Branchformer는 순차적 conv-plus-attention이 유일한 경로가 아니라는 설득력 있는 사례를 제시합니다. 이 리뷰는 두 논문을 나란히 다룹니다: Branchformer의 병렬 dual-branch 설계(전역 문맥을 위한 self-attention, 로컬 의존성을 위한 cgMLP)와 E-Branchformer의 향상된 병합 전략으로, 외부 데이터 없이 LibriSpeech test-clean 및 test-other WER을 1.81% 및 3.65%로 달성합니다.
이 설명은 로컬 및 전역 모델링을 병렬화하면 해석 가능성 이점(병합 가중치는 각 계층이 두 개를 어떻게 균형을 맞추는지를 명시적으로 보여줍니다), 단일 훈련된 모델에서의 가변 추론 복잡도, 그리고 Conformer 대비 더 나은 또는 일치하는 정확도를 제공함을 설명합니다. 13:40에서 지적된 정정사항을 참고하세요: 이는 ResNet 연결이 아니라 gating 연산입니다. E-Branchformer는 두 분기가 어떻게 결합되는지를 정제하고 추가 point-wise 모듈을 스택하여 최첨단 LibriSpeech WER을 달성함으로써 이를 기반으로 합니다. 다음 ASR 또는 SLU 시스템을 위한 인코더를 선택하거나, Conformer 이후 Transformer 계열 음성 모델이 어디로 향하고 있는지 이해하려고 한다면, 이 나란한 비교는 한 번에 충분한 양의 맥락을 제공합니다.
