BigSSL: 자동 음성 인식을 위한 대규모 준지도 학습의 경계 탐색
100M 매개변수에서 최첨단을 이긴 준지도 ASR 레시피를 가져다가 계속 확장하면 어떻게 될까요?
100M 매개변수에서 최첨단을 이긴 준지도 ASR 레시피를 가져다가 계속 확장하면 어떻게 될까요? Google의 BigSSL은 백만 시간의 레이블이 지정되지 않은 YouTube 오디오로 훈련된 80억 개 매개변수 Conformer로 답변합니다. 또한 수만 시간의 지도 데이터를 제공합니다. 그리고 특히 꼬리에서 이득이 계속 나타남을 보여줍니다: 저-리소스 도메인, 강조된 음성 및 장형 인식.
이 논문은 정말 두 가지 기여를 포함합니다. SSL을 10억 개의 매개변수를 넘어 밀 때 무엇이 깨지고 무엇이 확장되는지에 대한 경험적 연구이며, 단일 사전 훈련된 인코더가 수십 개의 다운스트림 ASR 작업에 대한 보편적 시작점으로 작용할 수 있으며 YouTube, 전화통신 및 음성 검색 벤치마크에서 WER을 감소시킨다는 증명입니다. 이 발표는 사전 훈련 파이프라인, 도메인 전반의 전송 결과, 그리고 기초 모델 접근 방식이 음성 스택에 적합한지 여부를 저울질하는 사람에게 실질적인 영향을 다룹니다. 규모에 맞는 다음 훈련 실행을 계획 중인 경우 대기열에 넣을 가치가 있습니다.
