Category: tutorials

News
[Short Review] Axial Attention in Multidimensional Transformers
Tutorials

[ショートレビュー] 多次元Transformerの軸方向注意

軸方向注意はTransformersを高次元データで扱いやすくする優雅なアイデアの1つです:すべてのピクセルまたはすべての時間周波数ビンを一度に注意する代わりに、一度に1つの軸に沿って注意します。

5月 28, 2022· 1 min read
[Long Review] Towards Zero-Label Language Learning
Tutorials

[ロングレビュー] ゼロラベル言語学習へ向けて

人間によるラベル付きの例がない状態でも、タスク固有のNLPモデルを訓練できたら?「ゼロラベル言語学習へ向けて」はこの問いに真正面から向き合っています。

5月 7, 2022· 1 min read
[Long Review] 'GShard': Scaling Giant Models with Conditional Computation and Automatic Sharding
Tutorials

[ロングレビュー] 「GShard」:条件付き計算と自動シャーディングを使用した巨大モデルのスケーリング

Transformerを1000億パラメータを超えてスケーリングすることは急速に哲学的になります:すべてのトークンに対してネットワーク全体をアクティブにしますか、それとも各トークンを実際に見る必要があるスペシャリストにルーティングしますか?

2月 26, 2022· 1 min read
Is Nathan Chen's 4 Flip scored by Mixture-of-Experts? Part 1: Switch Transformers: sparse MoE models
Tutorials

ネイサン・チェンの4フリップはMixture-of-Expertsでスコアリングされていますか?パート1:Switch Transformers:スパースMoEモデル

ネイサン・チェンのクワッドフリップスコアリングへのウインクを交わしてフレーミングされたこのトークは、Switch Transformerを詳細に説明します。これはGoogleによるMixture-of-Expertsスケーリングの明確で積極的に単純化された取り組みです。

2月 12, 2022· 1 min read
Is Nathan Chen's 4 Flip scored by Mixture-of-Experts? Part 2: GLaM:Efficient Scaling of LMs with MoE
Tutorials

ネイサン・チェンの4フリップはMixture-of-Expertsでスコア付けされているのか?パート2:GLaM:MoEによるLMsの効率的スケーリング

MoEミニシリーズのパート2はGLaMに向かい、Googleの1.2兆パラメータMixture-of-Expertsモデルは、ゼロショット、ワンショット、フューショットベンチマークでGPT-3に匹敵するか上回っており、パラメータの約8%のみを活性化しています

2月 12, 2022· 1 min read
BERT Paper Reviewed from a Speech Perspective
Tutorials

BERTペーパーをスピーチの視点からレビュー

BERTはNLPではほぼ紹介の必要がありませんが、スピーチエンジニアの目を通して読むと、標準的な「マスク言語モデリングがすべてを変えた」という要約とは異なるレッスンが明らかになります。

2月 6, 2022· 1 min read
Joint Unsupervised and Supervised Training for Multilingual ASR
Tutorials

多言語 ASR のための共同無教師学習と教師あり学習

事前学習-ファイン チューニングは多言語 ASR のデフォルト レシピになってきましたが、改善の余地があります。2 つのステージは損失を共有していないため、教師あり段階により有用な自己教師あり構造が静かに洗い流される可能性があります。

12月 4, 2021· 1 min read