BigSSL: Exploring the Frontier of Large-Scale Semi-Supervised Learning for Automatic Speech Recog

Tutorials

BigSSL: 自動音声認識のための大規模な半教師あり学習のフロンティアを探索する

100M パラメーターで最先端を上回る半教師あり ASR レシピを採用し、そのままスケーリングを続けるとどうなるでしょうか?

100M パラメーターで最先端を上回る半教師あり ASR レシピを採用し、そのままスケーリングを続けるとどうなるでしょうか? Google の BigSSL は、100 万時間のラベルなし YouTube オーディオと数万時間の教師付きデータでトレーニングされた 80 億パラメータの Conformer で答え、特に低リソースのドメイン、アクセントのある音声、長い形式の認識といった後部で成果が上がり続けていることを示しています。

この論文は実際には 2 つの寄稿を 1 つにまとめたものです。これは、SSL を 10 億パラメータを超えたときに何が壊れ、何がスケールするのかに関する実証研究であり、事前トレーニングされた単一のエンコーダが 12 個のダウンストリーム ASR タスクの普遍的な開始点として機能し、YouTube、電話、音声検索のベンチマークの WER の基準を同様に削減できることを実証しています。この講演では、事前トレーニング パイプライン、ドメイン間の転送結果、および基礎モデルのアプローチが音声スタックにとって意味があるかどうかを検討している人への実践的な影響について説明します。次回の大規模なトレーニングの実行を計画している場合は、並ぶ価値があります。