XLS-R: Self supervised Cross lingual Speech Representation Learning at Scale

Tutorials

XLS-R: 自己教師による大規模な異言語音声表現学習

井戸が枯渇する前に、言語を超えたスピーチの事前トレーニングをどこまで進めることができるでしょうか?

井戸が枯渇する前に、言語を超えたスピーチの事前トレーニングをどこまで進めることができるでしょうか? Meta の XLS-R は、128 言語にわたる 436,000 時間のラベルなし音声でトレーニングされた 20 億のパラメーターで答えます。これは、XLSR-53 を桁違いに飛び越えており、リリース時点では、大差を付けて最大の公開多言語音声モデルです。

結果はその規模の物語を裏付けています。 XLS-R は、BABEL、CommonVoice、および VoxPopuli の音声認識において新しい最先端技術を確立し、さらに驚くべきことには、英語への音声翻訳において、はるかに大規模なテキストサイド モデルに基づいて構築された以前のシステムを打ち負かしています。講演では、これら 128 言語にわたるデータのキュレーション、wav2vec 2.0 アーキテクチャが 2B パラメータにどのように耐えられるか、低リソースのデータでこれほど大きなものを微調整しようとすると何が壊れるかについて説明します。 HuggingFace でまだカバーされていない言語で音声タスクに取り組んでいる場合、おそらく XLS-R が最初に試すべきチェックポイントです。その理由については、詳しく説明します。