マイクロソフトのVALL-E 2レビュー(ゼロショットTTSで人間レベルの性能を達成)
ゼロショットTTSは多くの人がまだ数年先だと考えていたレベルを越えました。マイクロソフトのVALL-E 2は、LibriSpeechとVCTKの両方で、ロバスト性、自然性、スピーカー
3分でマイクロソフトのVALL-E 2を理解する(ゼロショットTTSで人間レベルの性能を達成)
時間がないが、なぜVALL-E 2が突然ゼロショットTTSのリファレンスになったのかを知りたい?
DiTARレビュー:音声生成のための拡散トランスフォーマーオートリグレッシブモデリング ~ Seed-TTS
Seed-TTSチームがDiTARで戻ってきました。これは現代の音声生成における最もぎこちないトレードオフの1つへのきれいな答えです:計算
ByteDance/TiktokのSeed-TTSレビュー:高品質で多用途な音声生成モデルのファミリー
ByteDanceのSeed-TTSは、TTSがコンポーネントから本物のファウンデーションモデルへ卒業していることを示す最も強いシグナルの1つです。
OpenAI WhisperからあなたのASRサービス自社へ:名前エンティティ&ドメイン固有用語の認識
Whisperはそのままで印象的ですが、実際に本番環境にデプロイした人なら誰もが知っているとおり、固有名詞、製品名、医療用語、法的専門用語、およびドメイン語彙の長い尾部全体で失敗します
MetaのMovie Gen vs OpenAIのSora:詳細なレビュー
Metaはついに手札を見せました、そしてMovie Genはビデオジェネレーターだけではありません—複数のアスペクト比で1080p HDビデオを生成する基盤モデルの集合であり、同期オーディオをサポートし、プレ
Googleの研究者によるエンドツーエンド音声認識の深層分析、第1部:概要&モデリング
深層学習の10年間でASRワード誤り率を相対的に50%以上削減し、その過程でクラシックなHMMパイプラインを遺物のように見えるようにしました。
OpenAIのGPT-4oのニューラルネットワークアーキテクチャを推測する
OpenAIはGPT-4oに関する論文を公開していないため、このビデオは次善の対策を講じています。OpenAIが実際に実演した機能に基づいて、ニューラルネットワークアーキテクチャがほぼ確実にどのようなものであるかをリバースエンジニアリングしています。
GoogleのUniversal Speech Modelが100以上の言語でOpenAIのWhisper Modelを上回る
GoogleのUniversal Speech Modelは、標識付きトレーニングデータをほぼ7分の1しか使用しない状態で、100以上の言語においてASRでOpenAIのWhisper と同等かそれを上回る、という驚くべき成果を静かに達成しました。
ロングレビュー: AppleのMM1: マルチモーダルLLM事前学習の方法、分析、インサイト
Appleはあまり論文を発表しないため、MM1の論文がマルチモーダルLLM事前学習の完全なアブレーション研究とともに発表されたとき、MLLMsを構築している人にとって年間最も有用なデータリリースの一つでした。
AppleのSOTAマルチモーダルLLMのクイックレビュー: MM1
MM1の完全な説明に時間がない場合は、このクイックレビューで数分で本質を学べます。Appleが構築したもの、アーキテクチャとデータのアブレーションから学んだもの、どの設計決定が
Claude 3がGPT-4を上回った秘密
Claude 3 OpusがMMU、GPQA、GSM8K、およびほぼすべてのフロンティア評価ベンチマークでGPT-4を上回ったとき、興味深い質問はAnthropicが単にスケールを大きくしたかどうかではなく、何がトレーニング時間のシークレットソース
Soraに関連する生成AIモデル: 正規化フロー
誰もが拡散について話しています。しかしSoraと現代の生成ビデオを生み出したファミリーツリーを理解したい場合は、正規化フローに時間を費やす必要があります - 生成モデルのクラス
変分オートエンコーダ (VAE) と再パラメータ化トリック - 古典的生成モデルの再検討
拡散の前に、正規化フローの前に、潜在拡散モデルがあらゆる本格的な生成スタックにVAEエンコーダを静かに組み込む前に、KingmaとWellingの2013年論文がありました。それは変分オートエンコーダを導入していました
Microsoft+OpenAI、Google、Meta、NvidiaのオープンソースLargeスピーチモデルのASRレビュー
あらゆる主要なAIラボは現在、ASR向けのオープンソースLargeスピーチモデルをリリースしており、本番環境向けに適切なものを選択することが実際の課題となりました。
【詳細論文読み解き】Zipformer: 自動音声認識のための高速でより優れたエンコーダ
Conformerはここ数年、デフォルトのASRエンコーダでしたが、k2/icefallチームのZipformerは静かにLibriSpeech、Aishell-1、WenetSpeechでWERの冠を奪い取りました。より高速でより軽量です。
Tycho: 高ROIの自社音声関連サービス (ASR/TTS/翻訳) を構築するためのツールキット:概要
自社のASR、TTS、または音声翻訳サービスが必要なほとんどのチームは、同じ厄介な選択に直面しています。ESPnet、NeMo、k2、HuggingFaceの断片を接ぎ合わせるか、すべてをクラウドAPIに任せて1分ごとに支払うかです。
OpenAIのWhisperモデルから自社ASRサービスまで:後処理と言語モデリング
生のWhisper出力は素晴らしいものですが、実際のユーザーにデプロイした経験がある人なら、デモトランスクリプトと下流システムが実際に利用できるもの間のギャップを知っています。
OpenAIのWhisperモデルから自社ASRサービスまで:長いオーディオとストリーミング(パート3)
Whisperは30秒のチャンクで訓練されており、2時間のポッドキャストをフィードするか、ライブキャプショニングパイプラインにワイアリングしようとする瞬間に見せています。
OpenAIのWhisperモデルから自社ASRサービスまで:ROI(投資対効果)(パート2)
ASRのビルド対バイの質問は、通常、精度と利便性としてフレーミングされていますが、実際の決定要因は製品のライフタイム全体にわたるROIです。
OpenAIのWhisperモデルから自社ASRサービスまで:概要(パート1)
OpenAIがWhisperをオープンソース化したとき、それは静かに自社ASRサービスが何のようなものであるかのベースラインをリセットしました。
OpenAI Whisperが生成した単語タイムスタンプが正確でない理由は?再度正確にする方法は?
Whisperに単語タイムスタンプを要求すると数字が返ってくる — しかし、実際の音声にカラオケ、キャプション、またはダビング用にそれを並べてみようとしたことがあれば、ドリフト、間違った境界へのスナップ、そして時々
音声生成AI:Meta AIによるVoiceBox(フローマッチングとニューラルODEも含む)
何年間も、音声生成はスケールと汎用性の両面でテキストと画像生成に遅れていた — すべてのタスクは独自の専用モデルを取得しました。
I-JEPA:Yann LeCunによるコンピュータビジョン用の最初の「ワールドモデル」
Yann LeCunは何年も、生成的事前訓練が世界を理解する機械を構築するための間違った賭けであると主張してきました。
LoRA:高校生がゲーミング用グラフィックスカードでLarge Language Model(GPT-3)を訓練できるようにする
175Bパラメータ数のGPT-3の完全な微調整は、ほぼ誰もが開始できない — ストレージだけでそれを除外し、GPUはおろか。
SpeechT5のレビュー: GoogleのT5をSpeech(ASR, TTS, SID, ...)タスクに導入
T5は単一のエンコーダ-デコーダ事前学習レシピのもとでテキスト間のタスクを統一し、NLPの主要なツールとなりました。
Deepmind's WaveNetのレビュー: TTS/音声合成 (GPTのように見えませんか?)
Tacotronより前に、VALL-Eより前に、ニューラルコデックがオーディオをトークンに変える前に、DeepMindのWaveNetは、ニューラルネットワークがサンプルごとに生のオーディオウェーブフォームを生成し、すべてのパラメトリックなanを上回ることができることを示した論文でした
HiFi-GANのレビュー: 効率的で高忠実度の音声合成のための生成的敵対的ネットワーク
長い間、ニューラルボコーダーはあなたに選択を強制しました:WaveNetのような自己回帰モデルは素晴らしいオーディオを提供しましたが、非常に遅かった一方で、GANベースの波形ジェネレーターは高速でしたが、目立って低品質でした。
GoogleのSoundStreamの詳細レビュー: エンドツーエンドニューラルオーディオコデック
ニューラルコデックは静かに最新の生成的オーディオの基盤層となり、SoundStreamはそのプロセスを開始した論文の1つです。
OpenAI GPT-4のvision+textモデル、データ、および訓練コストの開示(推測)
OpenAIはGPT-4のアーキテクチャ、パラメータ数、訓練データ、または計算予算の開示を拒否したことで有名であり、これはテックレポートをMLコミュニティのロールシャッハテストにしてしまいました。
