[短いレビュー] Wav2Seq: 擬似言語を使用した Speech-to-Text エンコーダ/デコーダ モデルの事前トレーニング
wav2vec 2.0 のような自己監視型事前トレーニングにより、優れた音声エンコーダが提供されましたが、完全なエンコーダ/デコーダ ASR システムが必要な場合、デコーダは依然としてゼロからのスタートでした。
wav2vec 2.0 のような自己監視型事前トレーニングにより、優れた音声エンコーダが提供されましたが、完全なエンコーダ/デコーダ ASR システムが必要な場合、デコーダは依然としてゼロからのスタートでした。 Wav2Seq は、擬似言語、音声特徴から派生した離散クラスター ID を発明し、音声を変換するために seq2seq Transformer 全体を事前トレーニングすることで、この問題を修正します。
この短いレビューでは、Wav2Seq レシピを重要な部分、疑似トークンの構築方法、結果として得られる事前トレーニング タスクが実際にダウンストリーム ASR および音声 NLU に役立つ理由、およびそれがエンコーダのみの事前トレーニング アプローチとどのように適合するかという重要な部分に抽出します。 seq2seq の注意に関する簡単な修正が含まれています。低リソースの音声テキスト変換の事前トレーニング戦略を評価している場合は、高速バージョンの再生をクリックしてください。
