HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units

Tutorials

HuBERT: 隠れユニットのマスク予測による自己教師あり音声表現学習

wav2vec 2.0 はコントラスティブ自己教師あり学習でゲームを変えましたが、HuBERT はより鋭い質問を投げかけました。コントラスティブなトリックをスキップして、単に音声に対して BERT スタイルのマスク予測を行ったらどうでしょうか?

wav2vec 2.0 はコントラスティブ自己教師あり学習でゲームを変えましたが、HuBERT はより鋭い質問を投げかけました。コントラスティブなトリックをスキップして、単に音声に対して BERT スタイルのマスク予測を行ったらどうでしょうか?課題は、オーディオには自然な語彙がないことです。そのため HuBERT は独自のものをブートストラップします。最初に MFCC をクラスタリングし、次にモデル自体の隠れ状態を反復的に再クラスタリングし、マスクされたフレーム上のそれらの疑似ラベルを予測するようにトランスフォーマーを訓練します。

利点は、より明確な目的関数と、Librispeech および Libri-light 上で Base から X-Large までのあらゆるモデル スケールで wav2vec 2.0 に匹敵またはそれを上回る結果です。Meta AI による本解説では、k-means ブートストラップ ループ、反復から音響ユニットが出現する理由、および同じ事前学習が ASR、話者 ID、感情タスクにクリーンに転送されるしくみについて説明しています。HuBERT は現在、音声表現作業を行う誰もが HuggingFace での定番の出発点の 1 つになっています。したがって、次の ASR または SLU プロジェクト用のエンコーダーを選択する場合、ここの直感に数分を費やすだけで、その後のハイパーパラメーター探索での何時間もの努力を節約できます。