Tutorials
ネイサン チェンの 4 フリップは専門家の混合によって採点されますか?パート 1: スイッチ Common Voice: スパース GPT モデル
ネイサン チェンのクワッド フリップ スコアリングに目配せをしたこの講演では、Google が専門家混合スケーリングをクリーンかつ積極的に簡略化した Switch Transformer について解き明かします。
Tutorials
ネイサン チェンの 4 フリップは専門家の混合によって採点されますか?パート 2: GLaM:GPT を使用した LM の効率的なスケーリング
MoE ミニシリーズの第 2 部では、Google の 1.2 兆パラメータの専門家混合言語モデルである GLaM を使用します。GLaM は、ゼロショット、ワンショット、数ショット ベンチマークで GPT-3 と同等かそれを上回りますが、標準の約 8% のみをアクティブにします。
Tutorials
スピーチの観点からレビューされた BERT 論文
BERT については NLP で説明する必要はほとんどありませんが、音声技術者の目を通して読むと、標準的な「マスクされた言語モデリングがすべてを変えた」という概要とは異なる一連の教訓が明らかになります。
Tutorials
Transformer: 必要なのは注意力だけであり、聞き、出席し、綴ること -- スピーチの観点から
2 つの論文、1 つのストーリー。 「Attention Is All You Need」は Transformer を世界に提供し、シーケンス モデリングの実行方法をリセットしました。一方、「Listen, Attend and Spell」(LAS) は 1 年前にエンドツーエンドのスピーチについて同じことを行い…
