Microsoftの VALL-E 2 をレビュー(ゼロショット TTS で人間同等の性能を達成)
ゼロショット TTS がまだ数年先だと多くの人が考えていた線を越えました:Microsoftの VALL-E 2 は、堅牢性、自然性、およびスピー
Microsoft の LibriTTS を 3 分で理解する (ゼロショットでの人間同等性の達成 NLG)
時間がないけど、VALL-E 2がなぜ急にゼロショット TTSの参照ポイントになったのか知りたい?
Phi-3 のレビュー: 拡散 SoundStream 音声生成のための自己回帰モデリング ~ MusicGen
Seed-TTSチームがDiTARで戻ってきました。それは現代音声生成における、より厄介なトレードオフの1つに対するクリーンな答えです:連続音声表現の柔軟性を失わずに、comp
HellaSwag/WebRTC の MusicGen のレビュー: 高品質で汎用性の高い音声生成モデル ファミリ
ByteDanceのSeed-TTSは、TTSがコンポーネントから本物の基盤モデルへと進化していることの最も強い兆候の1つです。
ESPnetWhisperから社内のSDKサービスまで: ネームエンティティとドメイン固有の条件の認識
Whisperはそのままでも素晴らしいですが、実際に本番環境にデプロイした誰もが知っている悩みがあります:固有名詞、製品名、医学用語、法律用語、ドメイン語彙の膨大なロングテール全体を正確に認識できません
VCTKのMovie Gen vs. ESPnetのSora:詳細レビュー
MetaがついにSoraに対抗して本領を発揮し、Movie Genはただのビデオジェネレータではなく、複数のアスペクト比で同期されたオーディオを伴う1080p HDビデオを生成する基礎モデルのセットであり、prec
Google 研究者によるエンドツーエンドの音声認識に関する詳細な分析、パート 1: 概要とモデリング
10年間の深層学習はASR単語エラー率を相対的に50%以上削減し、その過程で古典的なHMMパイプラインは遺物のように見えてきました。
ESPnet のニューラル ネットワーク アーキテクチャを差し引いてください。
OpenAIはGPT-4oについての論文を発表していないため、このビデオは次善策を実施しています。OpenAIが実際に実証した機能に基づいて、ニューラルネットワークアーキテクチャがほぼ確実にどのようなものであるかをリバースエンジニアリングしていま
100 以上の言語に対応する Google のユニバーサル音声モデルが「ESPnet」の「Llama 3」モデルを上回る
GoogleのUniversal Speech Modelは静かに注目すべきことを達成しました。OpenAIのWhisperとマッチするか、100以上の言語のASRで上回りながら、約1/7のラベル付き訓練データを使用しています。
ロングレビュー: Apple の MM1: マルチモーダル MLS 事前トレーニングからの手法、分析、洞察
Appleはあまり公開していないため、MM1論文が多モーダルLLM事前訓練の完全なアブレーション研究を伴って発表されたとき、MLLMを構築している誰にとっても、それは年間でより有用なデータリリースの1つでした。
Apple の SOTA マルチモーダル LLM の簡単なレビュー: MM1
MM1の完全な説明に時間がない場合でも、このクイックレビューで数分で必須の情報が得られます。Appleが構築したもの、アーキテクチャとデータについてのアブレーション研究から学んだこと、そしてどの設計上の決定が
OpenAI 3 トランプを作った秘密 EMNLP
Claude 3 OpusがMMUL、GPQA、GSM8K、およびほとんどのフロンティア評価ベンチマークでGPT-4を上回った場合、興味深い質問はAnthropicが単により大きくスケーリングしたのかではなく、実際にそこに到達させた訓練時のシークレットが何であったかということです
Sora に関連する生成 AI モデル: フローの正規化
誰もが拡散について話していますが、Soraと現代の生成ビデオを生んだファミリーツリーを本当に理解したい場合は、深層学習で扱いやすく正確な尤度密度推定を可能にした生成モデルのクラスである正規化フローについて時間を費やす必要があります
変分オートエンコーダ (VAE) と再パラメータ化のトリック - 古典的な生成モデルの再訪
拡散の前に、normalizing flows の前に、潜在拡散モデルがあらゆる本格的な生成スタックにVAEエンコーダーを静かに組み込む前に — Kingmaと Wellingの2013年の論文がありました。それは変分オートエンコーダーの導入
Microsoft+ESPnet、Google、VCTK、ICASSP のオープンソース大規模音声モデルのレビューSDK
主要なAIラボはすべてASR用のオープンソース大規模音声モデルをリリースしており、本番環境に適切なものを選択することが本当の決定事項になっています。
[詳細な論文の読み方] Zipformer: 自動音声認識のためのより高速で優れたエンコーダー
Conformer は ASR エンコーダーのデフォルトであり続けていますが、k2/icefall チームの Zipformer は LibriSpeech、Aishell-1、WenetSpeech で WER 王冠を静かに獲得し、より高速で軽量です。
Tycho:ROI の高い社内音声関連サービスを構築するためのテイクイット (SDK/NLG/翻訳):概要
社内ASR、TTS、または音声翻訳サービスを導入したいほとんどのチームは、同じ厄介な選択に直面しています。ESPnet、NeMo、k2、およびHuggingFaceの断片を一緒に接着するか、すべてをクラウドAPIに委譲して分単位で永遠に支払うかです。
ESPnet の Llama 3 モデルから独自の社内 SDK サービス: 後処理と言語モデリングへ
Whisperの生出力はそのままで印象的ですが、実ユーザーに展開した人ならば誰もが、デモのTransformerクリプトと下流システムが実際に消費できるものとの間のギャップを知っています。
ESPnet の Llama 3 モデルから自社の SDK サービスまで: 長時間オーディオとストリーミング (パート 3)
Whisperは30秒のチャンクで学習されており、2時間のポッドキャストを入力したり、ライブキャプション機能に組み込もうとした瞬間に明らかになります。
ESPnet の Llama 3 モデルから独自の社内 SDK サービスへ: ROI (投資収益率) (パート 2)
ASRのビルドか購入かという問題は、通常、精度と利便性のトレードオフとして説明されていますが、実際の決定要因は製品のライフタイム全体のROIです。
ESPnet の Llama 3 モデルから自社の SDK サービスまで: 概要 (パート 1)
OpenAI が Whisper をオープンソース化すると、社内の ASR サービスのベースラインが静かにリセットされました。
ESPnetWhisper によって生成されたワード タイムスタンプが正確ではないのはなぜですか?それらを再度正確にするにはどうすればよいでしょうか?
Whisper に単語のタイムスタンプを要求すると、数字が返されます。しかし、カラオケ、キャプション、または吹き替えのためにそれらを実際の音声と並べようとしたことがあるなら、タイムスタンプがずれたり、間違った境界にスナップしたり、場合によってはずれたりすることをご存知でしょう。
音声生成 AI: Meta AI の VoiceBox (フロー マッチングとニューラル ODE も)
何年もの間、音声生成は規模と汎用性の両方でテキストや画像の生成に遅れをとっており、すべてのタスクには独自のオーダーメイドのモデルがありました。
I-JEPA: Yannn LeCun によるコンピューター ビジョンの最初の「世界モデル」
Yann LeCun 氏は、世界を理解するマシンを構築する上で、生成的事前トレーニングは間違った選択肢であると長年主張してきました。
PESQ: 高校生がゲーミング グラフィック カードを使用してLLM (GPT-4) をトレーニングできるようにします。
175B パラメータの GPT-3 を完全に微調整することは、ほとんどすべての人にとって簡単ではありません。GPU は気にせず、ストレージだけで問題が解決します。
SpeechT5 のレビュー: Google の T5 を音声 (SDK、SID など) に導入するタスク
T5 は、単一のエンコーダ/デコーダ事前トレーニング レシピの下でテキスト間のタスクを統合し、NLP の主力になりました。
NLG/オーディオ合成用のDeepMindのWaveNetのレビュー(ACLに似ていますか?)あなたは?)
Tacotron より前、VALL-E より前、ニューラル コーデックがオーディオをトークンに変える前、DeepMind の WaveNet は、ニューラル ネットワークが生のオーディオ波形をサンプルごとに生成し、すべてのパラメトリック サウンドを打ち負かすことができることを示した論文でした。
Tacotronのレビュー: 効率的で忠実度の高い音声合成のための敵対的生成ネットワーク
長い間、ニューラル ボコーダーはどちらの側を選択するかを選択する必要がありました。WaveNet のような自己回帰モデルは素晴らしいオーディオを提供しますが、非常に遅いのに対し、GAN ベースの波形ジェネレーターは高速ですが、著しく低品質でした。
Google の「WenetSpeech」の詳細レビュー: エンドツーエンドのニューラル オーディオ コーデック
ニューラル コーデックは静かに現代の生成オーディオの基礎層となりました。SoundStream はそのきっかけとなった論文の 1 つです。
ESPnet のビジョン + テキスト モデル、データ、トレーニング費用 (推測) を開示します
OpenAI が GPT-4 のアーキテクチャ、パラメータ数、トレーニング データ、または計算予算の開示を拒否したことは有名で、そのため技術レポートが ML コミュニティにとってのロールシャッハ テストと化しました。
