博士がコンピュータを使ってズルして、2022年の大学入学試験の数学圧軸大問を解く
研究レベルのコンピュータ代数ツールキットを2022年の中国ガオカオ数学の最難問に活用するとどうなるでしょう?
[ロングレビュー] 高忠実度画像生成のためのカスケード型拡散モデル
ImagenとDALL-E 2が拡散を生成画像の標準にする前に、このGoogle Brainの論文は、その後の多くのテキスト・ツー・イメージシステムが静かに借用したカスケード型拡散のレシピを示しました:小さなもので始める
[ショートレビュー] 高忠実度画像生成のためのカスケード型拡散モデル
カスケード型拡散は多くの最新の生成的作業の基礎となる2段階以上のレシピです:1つの拡散モデルで小さな画像を生成し、その後、高周波詳細を追加する超解像拡散モデルに渡します
[ロングレビュー] 多次元Transformerの軸方向注意
画像またはビデオ全体にわたる完全な自己注意は禁止的に高価であるため、二次的なブローアップなしでTransformerの表現力をどのように保ちますか?
[ショートレビュー] 多次元Transformerの軸方向注意
軸方向注意はTransformersを高次元データで扱いやすくする優雅なアイデアの1つです:すべてのピクセルまたはすべての時間周波数ビンを一度に注意する代わりに、一度に1つの軸に沿って注意します。
[ロング レビュー] スピーカー検証からマルチスピーカー音声合成への転移学習
この論文は、ゼロショット音声クローニングを実用的にした論文です。数千の雑音を含む、トランスクリプト不要の音声でスピーカーエンコーダーを判別検証タスクで訓練し、これらの埋め込みをTacotron 2 s
[ショート レビュー] スピーカー検証からマルチスピーカー音声合成への転移学習
Googleのこの論文は、現代のゼロショット音声クローニングの波を起こしました。美しくシンプルなアーキテクチャを持っており、検証で訓練されたスピーカーエンコーダー、テキストとスピーカー埋め込みを受け取るTacotron 2合成器があります
[ロング レビュー] Wav2Seq: 疑似言語を使用した音声テキスト変換エンコーダーデコーダーモデルの事前訓練
ほとんどの音声事前訓練はエンコーダー側に焦点を当てています。wav2vec、HuBERT、WavLMですが、系列対系列ASRは事前訓練されたデコーダーも必要です。
[ショート レビュー] Wav2Seq: 疑似言語を使用した音声テキスト変換エンコーダーデコーダーモデルの事前訓練
wav2vec 2.0のような自己教師あり事前訓練により、素晴らしい音声エンコーダーが得られました。しかし、完全なエンコーダーデコーダーASRシステムが欲しい場合、デコーダーはまだゼロから開始していました。
[ロングレビュー] ゼロラベル言語学習へ向けて
人間によるラベル付きの例がない状態でも、タスク固有のNLPモデルを訓練できたら?「ゼロラベル言語学習へ向けて」はこの問いに真正面から向き合っています。
[ロングレビュー] 完全シャード化データ並列:より少ないGPUでより高速なAI訓練
限られたGPU予算で10億パラメータの音声モデルまたは言語モデルを訓練することは、パイプライン並列、テンソル並列、またはZeRO型オプティマイザシャーディング間での苦渋の選択を意味していました。
[ショートレビュー] 完全シャード化データ並列:より少ないGPUでより高速なAI訓練
完全シャード化データ並列(Fully Sharded Data Parallel)は、あらゆる音声チームと言語チームが最終的に問う質問へのMetaからの答えです:1桁大きいモデルを、1桁多いGPUをプロビジョニングせずに訓練するにはどうするか?
[ロングレビュー] 訓練データの重複排除により言語モデルが向上する
重複排除は退屈に聞こえるかもしれませんが、61語の単一文がC4内に60,000回以上出現すること、そのようなコーパスで訓練された言語モデルがユーザーに訓練セットテキストを不気味に
[ロングレビュー] CLAS: ディープコンテキスト: エンドツーエンド文脈的音声認識
ASR製品をリリースした人なら誰でも固有名詞の苦労を知っています: 連絡先の名前、曲のタイトル、医薬品の名前、不明瞭な地名。
[ロングレビュー] ファインチューニングされた言語モデルはゼロショット学習器
InstructGPTが指示チューニングを一般的な用語にする前に、GoogleのFLAN論文は、自然言語指示に対する適度な量のマルチタスク微調整が、普通のLMを驚くほど
[ロングレビュー] 「GShard」:条件付き計算と自動シャーディングを使用した巨大モデルのスケーリング
Transformerを1000億パラメータを超えてスケーリングすることは急速に哲学的になります:すべてのトークンに対してネットワーク全体をアクティブにしますか、それとも各トークンを実際に見る必要があるスペシャリストにルーティングしますか?
三つ子のようなロシアのフィギュアスケーター:Kullback-Leiblerダイバージェンスは彼らの違いを見分けるのに使用できますか?
スピーカー適応は、エンコーダーの獲得した音響表現を損なわないようにシーケンス・ツー・シーケンスモデルを適応させようとするまでは、解決されたように聞こえるASR問題の1つです。
ネイサン・チェンの4フリップはMixture-of-Expertsでスコアリングされていますか?パート1:Switch Transformers:スパースMoEモデル
ネイサン・チェンのクワッドフリップスコアリングへのウインクを交わしてフレーミングされたこのトークは、Switch Transformerを詳細に説明します。これはGoogleによるMixture-of-Expertsスケーリングの明確で積極的に単純化された取り組みです。
ネイサン・チェンの4フリップはMixture-of-Expertsでスコア付けされているのか?パート2:GLaM:MoEによるLMsの効率的スケーリング
MoEミニシリーズのパート2はGLaMに向かい、Googleの1.2兆パラメータMixture-of-Expertsモデルは、ゼロショット、ワンショット、フューショットベンチマークでGPT-3に匹敵するか上回っており、パラメータの約8%のみを活性化しています
BERTペーパーをスピーチの視点からレビュー
BERTはNLPではほぼ紹介の必要がありませんが、スピーチエンジニアの目を通して読むと、標準的な「マスク言語モデリングがすべてを変えた」という要約とは異なるレッスンが明らかになります。
Transformer:Attention is All You NeedとListen, Attend and Spell -- スピーチの視点から
2つの論文、1つのストーリー。「Attention Is All You Need」はTransformerを世界に与え、シーケンスモデリングの方法をリセットした一方で、「Listen, Attend and Spell」(LAS)はエンドツーエンドスピーチについて1年前に同じことを行いました
Breaking BadからWav2vec 2.0へ:スピーチ表現の自己教師あり学習フレームワーク
ウォルター・ホワイト、ジェシー・ピンクマン、そしてラベルなしオーディオのバッチに共通することは何か?
HuBERT: 隠れユニットのマスク予測による自己教師あり音声表現学習
wav2vec 2.0 はコントラスティブ自己教師あり学習でゲームを変えましたが、HuBERT はより鋭い質問を投げかけました。コントラスティブなトリックをスキップして、単に音声に対して BERT スタイルのマスク予測を行ったらどうでしょうか?
W2v-BERT: コントラスティブ学習とマスク言語モデリングを組み合わせた自己教師あり学習
音声事前学習のためのコントラスティブ学習とマスク言語モデリング、どちらか一方を選ぶ必要があるでしょうか?両方を同じネットワークに接続できるなら、その必要はありません。
多言語 ASR のための共同無教師学習と教師あり学習
事前学習-ファイン チューニングは多言語 ASR のデフォルト レシピになってきましたが、改善の余地があります。2 つのステージは損失を共有していないため、教師あり段階により有用な自己教師あり構造が静かに洗い流される可能性があります。
