音声感情認識の改善のための Wav2vec 2.0 ファイン チューニングの探索
音声感情認識は、小規模なラベル付きデータセットと手作りの音響特性に依存してきました。
音声感情認識は、小規模なラベル付きデータセットと手作りの音響特性に依存してきました。この論文は実際的な質問を投げかけています。ラベルなしオーディオで事前訓練された wav2vec 2.0 エンコーダーが IEMOCAP でこれらのパイプラインを実際に上回ることができるのか、そしてもしそうなら、どのファイン チューニング レシピが最も効果的なのかということです。著者らは、部分的対完全ファイン チューニング、プーリング戦略、およびトランスフォーマー スタックをどの程度アンフリーズするかについて、注意深い探索を行っています。
予想通り、答えは「はい」です。事前訓練は大いに役立ちます。しかし、興味深い部分は詳細にあります。どのレイヤーが感情識別情報を持つか、パラメータの凍結がいつ役に立たないか、そして小規模なラベル付きコーパスがどのように 300M パラメーター モデルを強い専門的ベースラインを超えることができるかということです。このウォークスルーでは、訓練セットアップ、重要なアブレーション、および一般的な SSL モデルを感情コンピューティング タスクに適応させる人向けの学びをカバーしています。コール センター分析ツール から、ユーザーの気分を読み取る音声アシスタント まで、何か構築する場合、ここのファイン チューニング トリックは直接応用できます。
