Google 연구원의 End-to-End 음성 인식에 대한 심층 분석, Part 1: 개요 & 모델링
딥러닝의 10년은 ASR 단어 오류율을 50% 이상 상대적으로 감소시켰고, 그 과정에서 고전적인 HMM 파이프라인을 유물처럼 보이게 만들었습니다.
딥러닝의 10년은 ASR 단어 오류율을 50% 이상 상대적으로 감소시켰고, 그 과정에서 고전적인 HMM 파이프라인을 유물처럼 보이게 만들었습니다. Prabhavalkar, Hori, Sainath, Schluter, 및 Watanabe의 End-to-End ASR 조사에 대한 이 Part 1 분석은 E2E ASR 모델의 분류를 설정하고 대부분의 근무 엔지니어들이 자란 HMM 유산에 대해 그것을 기초합니다. 이것은 나머지 조사를 클릭하게 만드는 framing 에피소드입니다.
개요는 모델링에 중점을 둡니다 — CTC, attention 기반 encoder-decoders, 및 transducer variants가 inductive bias에서 어떻게 다른지, ASR 도메인 전문 지식에 대한 감소된 의존성 측면에서 무엇을 얻을 수 있는지, 그리고 업계가 데이터에서 더 일관되게 배우는 all-neural stacks 주위에서 왜 통합했는지. 나중에 training, decoding, external language model integration, deployment, performance analysis, 및 필드의 미래 방향에 대한 부분을 설정합니다. 현대 ASR 팀에 가입하고 있거나 Kaldi 스타일 하이브리드와 Whisper, NeMo, ESPnet, 또는 transducer 기반 인식기 같은 것 사이에서 결정하려고 시도 중이라면, 이것이 terrain를 걷기 전에 원하는 지도입니다.
