WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing

Tutorials

WavLM: 풀 스택 음성 처리를 위한 대규모 자가 지도 사전 훈련

대부분의 음성 SSL 모델은 ASR에 최적화되어 있으며 다른 모든 것이 잘 작동하기를 바랍니다.

대부분의 음성 SSL 모델은 ASR에 최적화되어 있으며 다른 모든 것이 잘 작동하기를 바랍니다. Microsoft의 WavLM은 반대로 구축되었습니다. 한 번 사전 훈련하면 인식, 화자 확인, 분할, 분리, 전체 SUPERB 벤치마크 등 모든 작업이 수행됩니다. 비결은 transformer의 게이트된 상대 위치 바이어스와 사전 훈련 중 발화 혼합으로, 모델이 음성 표현이 아닌 화자 인식 및 잡음에 강한 표현을 학습하도록 합니다.

그 결과, SUPERB 리더보드가 상륙했을 때 깔끔하게 휩쓸었고, 특히 HuBERT와 wav2vec 2.0이 제대로 서비스를 제공하지 못하는 비ASR 작업에서 큰 이득을 얻었습니다. 이 세션에서는 훈련 시 발화 혼합이 실제로 어떤 모습인지, 위치 편향이 더 긴 컨텍스트에 중요한 이유, 94k 시간 사전 훈련 코퍼스가 어떻게 구성되었는지 살펴봅니다. 모든 다운스트림 음성 작업에 대해 별도의 인코더를 유지하는 데 지쳤다면 WavLM은 현재 HuggingFace에서 사용할 수 있는 가장 강력한 단일 백본 베팅 중 하나입니다. 심층 분석은 대기할 가치가 있습니다.