Joint Unsupervised and Supervised Training for Multilingual ASR

Tutorials

多言語 ASR のための共同無教師学習と教師あり学習

事前学習-ファイン チューニングは多言語 ASR のデフォルト レシピになってきましたが、改善の余地があります。2 つのステージは損失を共有していないため、教師あり段階により有用な自己教師あり構造が静かに洗い流される可能性があります。

事前学習-ファイン チューニングは多言語 ASR のデフォルト レシピになってきましたが、改善の余地があります。2 つのステージは損失を共有していないため、教師あり段階により有用な自己教師あり構造が静かに洗い流される可能性があります。Google の JUST フレームワークはそれらを 1 つの共同目的に統合します。コントラスティブ損失、マスク予測損失、および RNN-T 教師あり損失がすべて、同時に 1 つの共有エンコーダーをバックプロパゲートします。

42 言語の Multilingual Librispeech ベンチマークでは、JUST はカスケード事前学習パイプラインと純粋な教師あり ベースラインの両方を上回ります。ラベル付きデータがボトルネックである低リソース言語で特に大きな改善が得られます。このトークでは、3 つの損失がどのようにバランスされるか、共同訓練がスクリプトと音韻学の違いをまたいでより良く一般化される理由、およびアプローチがまだ言語固有のアダプターの余地を残している部分について説明しています。多言語 ASR スタックを管理していて、段階的な訓練実行に多くの時間を費やしている場合、この統合レシピは真剣に検討する価値があります。