W2v-BERT: 自己監視のための対照学習とマスク言語モデリングの組み合わせ
両方を同じネットワークに接続できるのに、音声の事前トレーニングに対照学習とマスク言語モデリングのどちらを選択する必要があるのでしょうか?
両方を同じネットワークに接続できるのに、音声の事前トレーニングに対照学習とマスク言語モデリングのどちらを選択する必要があるのでしょうか? Google の W2v-BERT は、wav2vec スタイルのコントラスト モジュールを BERT スタイルの MLM モジュールの上にスタックし、エンドツーエンドでトレーニングします。そのため、コントラスト損失によって学習された離散コードブックが MLM ヘッドの予測ターゲットになります。オフライン クラスタリングや 2 ステージ パイプラインはありません。
このシングル ループ設計は、単なるエンジニアリング上の選択以上のものであることが判明しました。 Librispeech テスト (その他) では、W2v-BERT は出版時点で新たな最低値 WER を記録し、Google の膨大な多言語音声検索データにきれいに一般化し、同等のパラメータ数で wav2vec 2.0 および HuBERT を上回りました。この講演では、2 つの損失項、なぜ共同トレーニングによってコードブックの使用が安定するのか、そしてモデルがダウンストリームの微調整のための余地をまだ残しているのかについて詳しく説明します。実稼働環境の ASR をどの自己監視型バックボーンに構築するかを評価している場合は、このバックボーンに 10 分間注目する価値があります。
