BERT Paper Reviewed from a Speech Perspective

Tutorials

スピーチの観点からレビューされた BERT 論文

BERT については NLP で説明する必要はほとんどありませんが、音声技術者の目を通して読むと、標準的な「マスクされた言語モデリングがすべてを変えた」という概要とは異なる一連の教訓が明らかになります。

BERT については NLP で説明する必要はほとんどありませんが、音声技術者の目を通して読むと、標準的な「マスクされた言語モデリングがすべてを変えた」という概要とは異なる一連の教訓が明らかになります。このレビューでは、「BERT: 言語理解のための深い双方向 Transformers の事前トレーニング」を再検討し、マスクされたトークンの目的、次の文の予測、および微調整レシピが、ASR の再スコアリング、音声言語の理解、または音声言語の事前トレーニングに取り組む人にとって何を意味するかを問います。

wav2vec 2.0、HuBERT、audio-BERT バリアントなどのモデルに引き継がれるものを対象とした解説とともに、アーキテクチャ、2 つの事前トレーニングの目的、一晩で GLUE の数値を押し上げた微調整の結果について説明します。音声エンコーダーを事前トレーニングする方法、または BERT スタイルの LM リスコアラーを ASR パイプラインに追加する方法を決定している場合、この視点は、どの BERT 設計の選択が本当に移植可能で、どのテキストの癖であるかを特定するのに役立ちます。スピーチの事前トレーニングが机の上にある場合は、一見の価値があります。