Tutorials
中国の航空母艦フジアン003のフェーズドアレイレーダーと音声ビームフォーミングとのつながり
中国の最新の航空母艦フジアン003に搭載されたフェーズドアレイレーダーと、スマートスピーカーが騒々しい部屋全体であなたの声を聞くことができるマイク配列は、実際には同じ基本的な数学を共有しています。
Tutorials
iOS 16の新しい音声入力はどのように機能するのか?音声研究者がAppleの秘策を明かす!
AppleのiOS 16音声入力はデバイス上で完全に実行され、この単一の設計選択は遅延、プライバシー、およびスマートフォンで実行可能なASRアーキテクチャの種類に連鎖的な影響を与えます。
Tutorials
【長編レビュー】Conformer:音声認識のための畳み込み拡張Transformer
Conformerはエンドツーエンド音声認識をひっそりと支配したモデルであり、Transformerブロック各々に畳み込みモジュールを追加するそのレシピは、その単純さの割に機能するという素晴らしいアイデアの一つになりました。
Tutorials
【短編レビュー】Conformer:音声認識のための畳み込み拡張Transformer
Conformerはほぼ地味なアプローチでASR界を席巻しました:各Transformerブロックに畳み込みモジュールを統合することで、モデルはグローバルコンテキストとローカル音響特性の両方を一度にキャプチャします。
Tutorials
博士がコンピュータを使ってズルして、2022年の大学入学試験の数学圧軸大問を解く
研究レベルのコンピュータ代数ツールキットを2022年の中国ガオカオ数学の最難問に活用するとどうなるでしょう?
Tutorials
[ロングレビュー] 高忠実度画像生成のためのカスケード型拡散モデル
ImagenとDALL-E 2が拡散を生成画像の標準にする前に、このGoogle Brainの論文は、その後の多くのテキスト・ツー・イメージシステムが静かに借用したカスケード型拡散のレシピを示しました:小さなもので始める
Tutorials
[ショートレビュー] 高忠実度画像生成のためのカスケード型拡散モデル
カスケード型拡散は多くの最新の生成的作業の基礎となる2段階以上のレシピです:1つの拡散モデルで小さな画像を生成し、その後、高周波詳細を追加する超解像拡散モデルに渡します
