Transformer: Attention is All You Need와 Listen, Attend and Spell -- 음성 관점에서
두 편의 논문, 하나의 이야기. "Attention Is All You Need"는 세계에 Transformer를 제공하고 수열 모델링이 어떻게 수행되는지를 재설정했고, "Listen, Attend and Spell" (LAS)은 엔드-투-엔드 음성에 대해 1년 먼저 동일한 일을 했습니다
두 편의 논문, 하나의 이야기. "Attention Is All You Need"는 세계에 Transformer를 제공하고 수열 모델링이 어떻게 수행되는지를 재설정했고, "Listen, Attend and Spell" (LAS)은 엔드-투-엔드 음성 인식에 대해 1년 먼저 동일한 일을 했으며, CTC-and-HMM 파이프라인을 단일 어텐션 기반 인코더-디코더로 대체했습니다. 음성 엔지니어의 관점에서 두 논문을 함께 읽으면, 현대 ASR이 처음 문자와 음소에서 테스트된 어텐션 메커니즘에 얼마나 많은 빚을 지고 있는지가 명확해집니다.
이 리뷰는 두 아키텍처를 정렬하고, LAS의 피라미드형 BLSTM 인코더와 콘텐츠 기반 어텐션에 대한 자기-어텐션을 대조하고, NLP와 음성 커뮤니티 사이에서 아이디어가 오늘날의 Conformer, Transducer, 그리고 Whisper 스타일 seq2seq ASR로 가는 방식에서 어떻게 이동했는지 추적합니다. 바닐라 Transformer에서 당신의 GPU에 지금 있는 음성 기초 모델로 연결되는 역사적 일관성을 원한다면, 이 깊이 있는 다이빙은 견고한 기초 세션입니다.
