[Long Review] Wav2Seq: Pre-training Speech-to-Text Encoder-Decoder Models Using Pseudo Languages

Tutorials

[장기 검토] Wav2Seq: 의사 언어를 사용한 음성-텍스트 인코더-디코더 모델 사전 훈련

대부분의 음성 사전 학습은 인코더 측, wav2vec, HuBERT, WavLM에 중점을 두었지만 시퀀스 간 ASR에는 사전 학습된 디코더도 필요합니다.

대부분의 음성 사전 학습은 인코더 측, wav2vec, HuBERT, WavLM에 중점을 두었지만 시퀀스 간 ASR에는 사전 학습된 디코더도 필요합니다. Wav2Seq는 영리한 트릭으로 이러한 격차를 해소합니다. 음성 표현을 개별 의사 토큰으로 클러스터링한 다음 해당 토큰을 합성 "의사 언어"로 처리하고 전체 인코더-디코더 Transformer를 사전 훈련하여 음성을 변환합니다.

이 장문의 검토에서는 Wav2Seq 파이프라인을 자세히 살펴보고, 의사 언어가 어떻게 구성되는지, 이를 실제 번역 대상으로 취급하여 디코더에 유용한 내용을 가르치는 이유, 사전 훈련된 모델이 다운스트림 ASR 및 음성 언어 이해 작업으로 전송되는 방법을 설명합니다. seq2seq 모듈의 attention에 대한 수정 사항이 포함되어 있습니다. 리소스가 적은 ASR, 계단식 음성-텍스트 변환 작업을 수행하거나 인코더를 넘어 자체 감독 사전 학습을 최대한 활용하려는 경우 심층 분석을 통해 이해할 가치가 있는 모든 설계 선택을 살펴보세요.