XLS-R: 규모의 자가 감독 교차 언어 음성 표현 학습
우물이 마르기 전에 교차 언어 음성 사전 학습을 얼마나 멀리 밀어붙일 수 있을까요?
교차 언어 음성 사전 학습을 얼마나 멀리 밀어붙일 수 있을까요? Meta의 XLS-R은 128개 언어에 걸쳐 436,000시간의 레이블 없는 오디오로 학습된 20억 개의 파라미터로 답합니다 — XLSR-53에 비해 한 자릿수 점프이며, 출시 당시 가장 큰 공개 다중언어 음성 모델입니다.
결과는 규모 이야기를 뒷받침합니다. XLS-R은 BABEL, CommonVoice 및 VoxPopuli 음성 인식에서 새로운 최첨단 성과를 기록했으며 — 아마도 더 놀랍게도 — 훨씬 더 큰 텍스트 기반 모델로 구축된 이전 시스템을 능가하는 영어로의 음성 번역에서도 그렇습니다. 이 발표는 128개 언어 전반의 데이터 큐레이션, 20억 파라미터에서 wav2vec 2.0 아키텍처가 어떻게 작동하는지, 그리고 저리소스 데이터에서 이렇게 큰 것을 미세 조정하려고 할 때 무엇이 깨지는지를 살펴봅니다. HuggingFace가 아직 다루지 않은 언어에서 음성 작업을 하고 있다면, XLS-R은 아마도 먼저 시도해야 할 체크포인트일 것입니다 — 상세 분석은 이해할 가치가 있습니다.
