[ロングレビュー] Wav2Seq: 擬似言語を使用した音声テキスト変換エンコーダー/デコーダー モデルの事前トレーニング
ほとんどの音声事前トレーニングは、wav2vec、HuBERT、WavLM などのエンコーダ側に焦点を当てていますが、シーケンス間 ASR には事前トレーニングされたデコーダも必要です。
ほとんどの音声事前トレーニングは、wav2vec、HuBERT、WavLM などのエンコーダ側に焦点を当てていますが、シーケンス間 ASR には事前トレーニングされたデコーダも必要です。 Wav2Seq は、賢いトリックでそのギャップを埋めます。音声表現を個別の擬似トークンにクラスター化し、それらのトークンを合成「擬似言語」として扱い、音声をそれに翻訳するために完全なエンコーダー/デコーダー Transformer を事前トレーニングします。
この長い形式のレビューでは、Wav2Seq パイプラインを詳細に説明し、疑似言語がどのように構築されるか、実際の翻訳ターゲットとして扱うことでデコーダーに何か有益なことを教える理由、および事前トレーニングされたモデルがどのようにダウンストリームの ASR および音声言語理解タスクに転送されるかについて説明します。 seq2seqモジュールの注意点の修正が含まれています。低リソースの ASR、カスケード音声テキスト変換に取り組んでいる場合、またはエンコーダを超えた自己教師あり事前トレーニングからさらに多くを絞り出そうとしている場合は、理解する価値のあるすべての設計上の選択について詳しく説明します。
