WavLM: フルスタック音声処理のための大規模な自己教師あり事前トレーニング
ほとんどの音声 SSL モデルは ASR に対して最適化されており、他のすべてがうまくいくことを願っています。
ほとんどの音声 SSL モデルは ASR に対して最適化されており、他のすべてがうまくいくことを願っています。 Microsoft の WavLM は、逆の方法で構築されています。つまり、一度事前トレーニングすれば、認識、話者検証、ダイアライゼーション、分離、完全な SUPERB ベンチマークなど、すべてを実行できます。その秘訣は、transformer のゲートされた相対位置バイアスと、事前トレーニング中の発話ミキシングです。これにより、モデルは単なる音声表現ではなく、話者を意識したノイズ耐性のある表現を学習するようになります。
その結果、SUPERB のリーダーボードが完全に席巻され、HuBERT と wav2vec 2.0 では十分に対応できない傾向にある非 ASR タスクで特に大幅な向上が見られました。このセッションでは、トレーニング時の発話混合が実際にどのようなものであるか、位置バイアスが長いコンテキストで重要となる理由、および 94,000 時間の事前トレーニング コーパスがどのように組み立てられたかについて説明します。ダウンストリーム音声タスクごとに個別のエンコーダを維持するのにうんざりしている場合は、WavLM が現在 HuggingFace で利用できる単一バックボーンの中で最も強力な選択肢の 1 つです。詳しく調べるには、列に並ぶ価値があります。
