Joint Unsupervised and Supervised Training for Multilingual ASR

Tutorials

다국어 ASR을 위한 공동 비지도학습 및 지도학습 훈련

사전 훈련 후 미세 조정이 다국어 ASR의 기본 레시피가 되었지만, 많은 잠재력을 남기고 있습니다: 두 단계가 손실을 공유하지 않으며, 지도 단계가 유용한 자체 지도 구조를 조용히 제거할 수 있습니다

사전 훈련 후 미세 조정이 다국어 ASR의 기본 레시피가 되었지만, 많은 잠재력을 남기고 있습니다: 두 단계가 손실을 공유하지 않으며, 지도 단계가 유용한 자체 지도 구조를 조용히 제거할 수 있습니다. Google의 JUST 프레임워크는 이들을 단일 공동 목표로 융합합니다 — 대조 손실, 마스킹된 예측 손실, 그리고 RNN-T 지도 손실이 모두 같은 시간에 하나의 공유 인코더를 통해 역전파됩니다.

42개 언어 Multilingual Librispeech 벤치마크에서 JUST는 계단식 사전 훈련 파이프라인과 순수 지도 기준선을 모두 능가하며, 특히 레이블된 데이터가 병목 지점인 저자원 언어에서 강력한 향상을 보입니다. 이 강연은 세 손실 항이 어떻게 균형을 이루는지, 공동 훈련이 왜 코드북 사용을 일반화하는지, 그리고 접근 방식이 여전히 언어 특화 어댑터를 위해 남겨둔 여유를 설명합니다. 다국어 ASR 스택을 다루고 있으며 단계별 훈련 실행에 사이클을 소모하고 있다면, 이 원-팟 레시피는 진지한 주목의 가치가 있습니다.