[Olewaveのレビュー] CLIP (3/3): 自然言語監督から転移可能な視覚モデルを学習する
このCLIPレビューの最後の部分は結果セクションに着地します。ここはOpenAIの対比的画像テキストモデルが興味深いアイデアから、マルチモーダルスタック全体の基盤レイヤープリミティブへとシフトした場所です。
[Olewaveのレビュー] CLIP (2/3): 自然言語監督から転移可能な視覚モデルを学習する
OpenAIのCLIPは、固定されたラベルセットを廃止し、代わりにインターネットからスクレイピングされた400百万の(画像、テキスト)ペアで訓練することで、コンピュータビジョンのスクリプトを逆転させました。
[Olewaveのレビュー] CLIP (1/3): 自然言語監督から転移可能な視覚モデルを学習する
BLIPやLLaVA、またはまともな音声LLMが登場する前に、CLIPがありました。これがストーリーの始まりです。
Boris Johnsonの台頭と衰退 - マイクの分析
政治ニュースは通常、音声AIエンジニアが金曜日の午後にキューに入れるものではありませんが、Boris Johnsonの辞任発表は、マイクの銀行の前で行われ、彼の党がスキャンダルの連鎖で反乱を起こしたため
[Olewnaveのロングレビュー] Xception: 深層学習による深さ方向分離可能畳み込み
XceptionはInceptionの仮説を論理的極限まで推し進め、チャネル間および空間相関を完全に分離された操作に分離し、それが普及させた深さ方向分離可能畳み込みはあらゆる場所に登場しています
中国の航空母艦フジアン003のフェーズドアレイレーダーと音声ビームフォーミングとのつながり
中国の最新の航空母艦フジアン003に搭載されたフェーズドアレイレーダーと、スマートスピーカーが騒々しい部屋全体であなたの声を聞くことができるマイク配列は、実際には同じ基本的な数学を共有しています。
iOS 16の新しい音声入力はどのように機能するのか?音声研究者がAppleの秘策を明かす!
AppleのiOS 16音声入力はデバイス上で完全に実行され、この単一の設計選択は遅延、プライバシー、およびスマートフォンで実行可能なASRアーキテクチャの種類に連鎖的な影響を与えます。
【長編レビュー】Conformer:音声認識のための畳み込み拡張Transformer
Conformerはエンドツーエンド音声認識をひっそりと支配したモデルであり、Transformerブロック各々に畳み込みモジュールを追加するそのレシピは、その単純さの割に機能するという素晴らしいアイデアの一つになりました。
[ロングレビュー] 高忠実度画像生成のためのカスケード型拡散モデル
ImagenとDALL-E 2が拡散を生成画像の標準にする前に、このGoogle Brainの論文は、その後の多くのテキスト・ツー・イメージシステムが静かに借用したカスケード型拡散のレシピを示しました:小さなもので始める
[ショートレビュー] 高忠実度画像生成のためのカスケード型拡散モデル
カスケード型拡散は多くの最新の生成的作業の基礎となる2段階以上のレシピです:1つの拡散モデルで小さな画像を生成し、その後、高周波詳細を追加する超解像拡散モデルに渡します
[ロングレビュー] 多次元Transformerの軸方向注意
画像またはビデオ全体にわたる完全な自己注意は禁止的に高価であるため、二次的なブローアップなしでTransformerの表現力をどのように保ちますか?
[ショートレビュー] 多次元Transformerの軸方向注意
軸方向注意はTransformersを高次元データで扱いやすくする優雅なアイデアの1つです:すべてのピクセルまたはすべての時間周波数ビンを一度に注意する代わりに、一度に1つの軸に沿って注意します。
[ロング レビュー] スピーカー検証からマルチスピーカー音声合成への転移学習
この論文は、ゼロショット音声クローニングを実用的にした論文です。数千の雑音を含む、トランスクリプト不要の音声でスピーカーエンコーダーを判別検証タスクで訓練し、これらの埋め込みをTacotron 2 s
[ショート レビュー] スピーカー検証からマルチスピーカー音声合成への転移学習
Googleのこの論文は、現代のゼロショット音声クローニングの波を起こしました。美しくシンプルなアーキテクチャを持っており、検証で訓練されたスピーカーエンコーダー、テキストとスピーカー埋め込みを受け取るTacotron 2合成器があります
[ショート レビュー] Wav2Seq: 疑似言語を使用した音声テキスト変換エンコーダーデコーダーモデルの事前訓練
wav2vec 2.0のような自己教師あり事前訓練により、素晴らしい音声エンコーダーが得られました。しかし、完全なエンコーダーデコーダーASRシステムが欲しい場合、デコーダーはまだゼロから開始していました。
[ロングレビュー] ゼロラベル言語学習へ向けて
人間によるラベル付きの例がない状態でも、タスク固有のNLPモデルを訓練できたら?「ゼロラベル言語学習へ向けて」はこの問いに真正面から向き合っています。
[ロングレビュー] 完全シャード化データ並列:より少ないGPUでより高速なAI訓練
限られたGPU予算で10億パラメータの音声モデルまたは言語モデルを訓練することは、パイプライン並列、テンソル並列、またはZeRO型オプティマイザシャーディング間での苦渋の選択を意味していました。
[ショートレビュー] 完全シャード化データ並列:より少ないGPUでより高速なAI訓練
完全シャード化データ並列(Fully Sharded Data Parallel)は、あらゆる音声チームと言語チームが最終的に問う質問へのMetaからの答えです:1桁大きいモデルを、1桁多いGPUをプロビジョニングせずに訓練するにはどうするか?
