[ロングレビュー] 高忠実度画像生成のためのカスケード拡散モデル
Imagen と DALL-E 2 が拡散を生成画像のデフォルトにする前に、この Google Brain 論文では、後の多くのテキストから画像へのシステムが密かに借用したカスケード拡散レシピを説明しました。
[短いレビュー] 高忠実度画像生成のためのカスケード拡散モデル
カスケード拡散は、現代の多くの生成作業の基礎となる 2 段階以上のレシピです。1 つの拡散モデルで小さな画像を生成し、それを高周波の詳細を追加する超解像度拡散モデルに渡します。
[長いレビュー] 多次元における軸方向の注意 Transformers
画像やビデオに完全に注意を向けるには法外なコストがかかります。では、二次関数の爆発を避けて Transformer の表現力を維持するにはどうすればよいでしょうか?
[短いレビュー] 多次元における軸方向の注意
軸方向の注意は、高次元データで Transformers を扱いやすくするエレガントなアイデアの 1 つです。すべてのピクセルまたはすべての時間周波数ビンを一度に処理するのではなく、一度に 1 つの軸に沿って処理します。
[ロングレビュー] 話者検証からマルチ話者テキスト読み上げ合成への転移学習
これは、ゼロショット音声クローン作成を実用化した論文です。何千ものノイズの多い、Transformerクリプトのない音声を使用して識別検証タスクでスピーカー エンコーダーをトレーニングし、それらのエンベディングを Tacotron 2 にフィードします。
[短いレビュー] 話者検証からマルチ話者テキスト読み上げ合成への転移学習
最新のゼロショット音声クローン作成の波を始めた Google の論文は、美しくクリーンなアーキテクチャを備えています。検証でトレーニングされたスピーカー エンコーダー、テキストを変換する Tacotron 2 シンセサイザーとスピーカーの埋め込みです。
[短いレビュー] Wav2Seq: 擬似言語を使用した Speech-to-Text エンコーダ/デコーダ モデルの事前トレーニング
wav2vec 2.0 のような自己監視型事前トレーニングにより、優れた音声エンコーダが提供されましたが、完全なエンコーダ/デコーダ ASR システムが必要な場合、デコーダは依然としてゼロからのスタートでした。
[ロングレビュー] ゼロラベル言語学習に向けて
人間がラベルを付けたサンプルを 1 つも使用せずに、タスク固有の NLP モデルをトレーニングできたらどうでしょうか? 「ゼロラベル言語学習に向けて」は、その疑問に真剣に取り組んでいます。
