[숏 리뷰] Wav2Seq: Pseudo Languages를 사용한 Speech-to-Text Encoder-Decoder Models의 Pre-training
wav2vec 2.0 같은 Self-supervised pretraining은 훌륭한 speech encoder를 제공했습니다, 하지만 전체 encoder-decoder ASR 시스템을 원하면, decoder는 여전히 처음부터 시작했습니다.
wav2vec 2.0 같은 Self-supervised pretraining은 훌륭한 speech encoder를 제공했습니다, 하지만 전체 encoder-decoder ASR 시스템을 원하면, decoder는 여전히 처음부터 시작했습니다. Wav2Seq는 pseudo language, speech 특징에서 파생된 이산 cluster ID를 발명하고 전체 seq2seq Transformer를 오디오를 그것으로 번역하는 pretraining을 함으로써 그것을 해결합니다.
이 숏 리뷰는 Wav2Seq 레시피를 중요한 부분으로 정제합니다: pseudo token이 어떻게 구축되는지, 결과 pretraining 작업이 왜 실제로 downstream ASR 및 spoken NLU에 도움이 되는지, 그리고 encoder-only pretraining 접근 방식과 함께 어떻게 맞는지. seq2seq attention에 대한 빠른 수정사항이 포함됩니다. 저리소스 speech-to-text를 위한 pretraining 전략을 평가하는 경우, 빠른 버전을 재생해주세요.
