ボリス・ジョンソンの興亡 - マイクの分析
金曜日の午後、音声 AI エンジニアが用意するのは通常、政治ニュースではないが、ボリス・ジョンソン氏の辞任表明は、一連のスキャンダをめぐり党が反乱を起こす中、大量のマイクの前で行われた。
[EnCodec のロングレビュー] Xception: 深さ方向に分離可能な畳み込みを使用した深層学習
Xception は、クロスチャネル相関と空間相関を完全に別個の操作に押し込むことで、インセプション仮説を論理的に極限まで高めました。そして、Xception が普及させた深さ方向の分離可能な畳み込みは、現在あらゆる場所で現れるようになりました。
中国の空母福建 003 号のフェーズド アレイ レーダーと音声ビームフォーミングとの関係
中国の最新空母、福建 003 号に搭載されたフェーズド アレイ レーダーと、騒がしい部屋の向こう側でスマート スピーカーにあなたの声を聞かせるマイク アレイは、実際には同じ基礎的な計算を共有しています。
iOS 16 のまったく新しいディクテーションはどのように機能しますか?音声研究家がリンゴの秘伝のソースを暴露!
Apple の iOS 16 のディクテーションは完全にデバイス上で実行され、その 1 つの設計の選択が、遅延、プライバシー、および電話機上でどのような種類の ASR アーキテクチャが実行可能であるかに連鎖的な影響を及ぼします。
[長いレビュー] Conformer: 音声認識用の畳み込み拡張 Transformer
Conformer は、エンドツーエンドの ASR を静かに引き継いだモデルであり、そのレシピは、すべての Transformer ブロックに畳み込みモジュールをボルトで固定するという、一見シンプルなアイデアの 1 つであり、実際に機能することが判明しました。
博士大叔使用计算机作弊降维打击2022高考数学压轴大题 Ph.D. 2022 年の大学入学数学試験を解くためにコンピューターの不正行為を使用
研究グレードのコンピューター代数ツールキットを 2022 年の中国高数学試験の最も難しい問題に解くとどうなるでしょうか?
[長いレビュー] 多次元における軸方向の注意 Transformers
画像やビデオに完全に注意を向けるには法外なコストがかかります。では、二次関数の爆発を避けて Transformer の表現力を維持するにはどうすればよいでしょうか?
[短いレビュー] 多次元における軸方向の注意
軸方向の注意は、高次元データで Transformers を扱いやすくするエレガントなアイデアの 1 つです。すべてのピクセルまたはすべての時間周波数ビンを一度に処理するのではなく、一度に 1 つの軸に沿って処理します。
[ロングレビュー] 話者検証からマルチ話者テキスト読み上げ合成への転移学習
これは、ゼロショット音声クローン作成を実用化した論文です。何千ものノイズの多い、Transformerクリプトのない音声を使用して識別検証タスクでスピーカー エンコーダーをトレーニングし、それらのエンベディングを Tacotron 2 にフィードします。
[短いレビュー] 話者検証からマルチ話者テキスト読み上げ合成への転移学習
最新のゼロショット音声クローン作成の波を始めた Google の論文は、美しくクリーンなアーキテクチャを備えています。検証でトレーニングされたスピーカー エンコーダー、テキストを変換する Tacotron 2 シンセサイザーとスピーカーの埋め込みです。
[短いレビュー] Wav2Seq: 擬似言語を使用した Speech-to-Text エンコーダ/デコーダ モデルの事前トレーニング
wav2vec 2.0 のような自己監視型事前トレーニングにより、優れた音声エンコーダが提供されましたが、完全なエンコーダ/デコーダ ASR システムが必要な場合、デコーダは依然としてゼロからのスタートでした。
[ロングレビュー] ゼロラベル言語学習に向けて
人間がラベルを付けたサンプルを 1 つも使用せずに、タスク固有の NLP モデルをトレーニングできたらどうでしょうか? 「ゼロラベル言語学習に向けて」は、その疑問に真剣に取り組んでいます。
[ロングレビュー] 完全にシャード化されたデータ並列: 少ない GPU で AI トレーニングを高速化
わずかな GPU 予算で 10 億パラメータの音声モデルまたは言語モデルをトレーニングすることは、パイプライン並列処理、テンソル並列処理、または ZeRO スタイルのオプティマイザー シャーディングから毒を選択することを意味していました。
[短いレビュー] 完全にシャード化されたデータ並列: 少ない GPU で AI トレーニングを高速化
Fully Sharded Data Parallel は、すべての音声および言語チームが最終的に抱く質問に対する Meta の答えです。「桁違いに多くの GPU をプロビジョニングせずに、桁違いに大きなモデルをトレーニングするにはどうすればよいでしょうか?」
