Tutorials
I-JEPA:Yann LeCunによるコンピュータビジョン用の最初の「ワールドモデル」
Yann LeCunは何年も、生成的事前訓練が世界を理解する機械を構築するための間違った賭けであると主張してきました。
Tutorials
[ロングレビュー] 多次元Transformerの軸方向注意
画像またはビデオ全体にわたる完全な自己注意は禁止的に高価であるため、二次的なブローアップなしでTransformerの表現力をどのように保ちますか?
Tutorials
[ショートレビュー] 多次元Transformerの軸方向注意
軸方向注意はTransformersを高次元データで扱いやすくする優雅なアイデアの1つです:すべてのピクセルまたはすべての時間周波数ビンを一度に注意する代わりに、一度に1つの軸に沿って注意します。
Tutorials
[ロング レビュー] スピーカー検証からマルチスピーカー音声合成への転移学習
この論文は、ゼロショット音声クローニングを実用的にした論文です。数千の雑音を含む、トランスクリプト不要の音声でスピーカーエンコーダーを判別検証タスクで訓練し、これらの埋め込みをTacotron 2 s
Tutorials
[ショート レビュー] スピーカー検証からマルチスピーカー音声合成への転移学習
Googleのこの論文は、現代のゼロショット音声クローニングの波を起こしました。美しくシンプルなアーキテクチャを持っており、検証で訓練されたスピーカーエンコーダー、テキストとスピーカー埋め込みを受け取るTacotron 2合成器があります
Tutorials
[ショート レビュー] Wav2Seq: 疑似言語を使用した音声テキスト変換エンコーダーデコーダーモデルの事前訓練
wav2vec 2.0のような自己教師あり事前訓練により、素晴らしい音声エンコーダーが得られました。しかし、完全なエンコーダーデコーダーASRシステムが欲しい場合、デコーダーはまだゼロから開始していました。
Tutorials
[ロングレビュー] ゼロラベル言語学習へ向けて
人間によるラベル付きの例がない状態でも、タスク固有のNLPモデルを訓練できたら?「ゼロラベル言語学習へ向けて」はこの問いに真正面から向き合っています。
