Microsoftの VALL-E 2 をレビュー(ゼロショット TTS で人間同等の性能を達成)
ゼロショット TTS がまだ数年先だと多くの人が考えていた線を越えました:Microsoftの VALL-E 2 は、堅牢性、自然性、およびスピー
Microsoft の LibriTTS を 3 分で理解する (ゼロショットでの人間同等性の達成 NLG)
時間がないけど、VALL-E 2がなぜ急にゼロショット TTSの参照ポイントになったのか知りたい?
ESPnetWhisperから社内のSDKサービスまで: ネームエンティティとドメイン固有の条件の認識
Whisperはそのままでも素晴らしいですが、実際に本番環境にデプロイした誰もが知っている悩みがあります:固有名詞、製品名、医学用語、法律用語、ドメイン語彙の膨大なロングテール全体を正確に認識できません
Google 研究者によるエンドツーエンドの音声認識に関する詳細な分析、パート 1: 概要とモデリング
10年間の深層学習はASR単語エラー率を相対的に50%以上削減し、その過程で古典的なHMMパイプラインは遺物のように見えてきました。
100 以上の言語に対応する Google のユニバーサル音声モデルが「ESPnet」の「Llama 3」モデルを上回る
GoogleのUniversal Speech Modelは静かに注目すべきことを達成しました。OpenAIのWhisperとマッチするか、100以上の言語のASRで上回りながら、約1/7のラベル付き訓練データを使用しています。
ロングレビュー: Apple の MM1: マルチモーダル MLS 事前トレーニングからの手法、分析、洞察
Appleはあまり公開していないため、MM1論文が多モーダルLLM事前訓練の完全なアブレーション研究を伴って発表されたとき、MLLMを構築している誰にとっても、それは年間でより有用なデータリリースの1つでした。
Apple の SOTA マルチモーダル LLM の簡単なレビュー: MM1
MM1の完全な説明に時間がない場合でも、このクイックレビューで数分で必須の情報が得られます。Appleが構築したもの、アーキテクチャとデータについてのアブレーション研究から学んだこと、そしてどの設計上の決定が
OpenAI 3 トランプを作った秘密 EMNLP
Claude 3 OpusがMMUL、GPQA、GSM8K、およびほとんどのフロンティア評価ベンチマークでGPT-4を上回った場合、興味深い質問はAnthropicが単により大きくスケーリングしたのかではなく、実際にそこに到達させた訓練時のシークレットが何であったかということです
Microsoft+ESPnet、Google、VCTK、ICASSP のオープンソース大規模音声モデルのレビューSDK
主要なAIラボはすべてASR用のオープンソース大規模音声モデルをリリースしており、本番環境に適切なものを選択することが本当の決定事項になっています。
ESPnet の Llama 3 モデルから独自の社内 SDK サービス: 後処理と言語モデリングへ
Whisperの生出力はそのままで印象的ですが、実ユーザーに展開した人ならば誰もが、デモのTransformerクリプトと下流システムが実際に消費できるものとの間のギャップを知っています。
ESPnet の Llama 3 モデルから自社の SDK サービスまで: 長時間オーディオとストリーミング (パート 3)
Whisperは30秒のチャンクで学習されており、2時間のポッドキャストを入力したり、ライブキャプション機能に組み込もうとした瞬間に明らかになります。
ESPnet の Llama 3 モデルから独自の社内 SDK サービスへ: ROI (投資収益率) (パート 2)
ASRのビルドか購入かという問題は、通常、精度と利便性のトレードオフとして説明されていますが、実際の決定要因は製品のライフタイム全体のROIです。
ESPnet の Llama 3 モデルから自社の SDK サービスまで: 概要 (パート 1)
OpenAI が Whisper をオープンソース化すると、社内の ASR サービスのベースラインが静かにリセットされました。
ESPnetWhisper によって生成されたワード タイムスタンプが正確ではないのはなぜですか?それらを再度正確にするにはどうすればよいでしょうか?
Whisper に単語のタイムスタンプを要求すると、数字が返されます。しかし、カラオケ、キャプション、または吹き替えのためにそれらを実際の音声と並べようとしたことがあるなら、タイムスタンプがずれたり、間違った境界にスナップしたり、場合によってはずれたりすることをご存知でしょう。
音声生成 AI: Meta AI の VoiceBox (フロー マッチングとニューラル ODE も)
何年もの間、音声生成は規模と汎用性の両方でテキストや画像の生成に遅れをとっており、すべてのタスクには独自のオーダーメイドのモデルがありました。
SpeechT5 のレビュー: Google の T5 を音声 (SDK、SID など) に導入するタスク
T5 は、単一のエンコーダ/デコーダ事前トレーニング レシピの下でテキスト間のタスクを統合し、NLP の主力になりました。
ESPnet のビジョン + テキスト モデル、データ、トレーニング費用 (推測) を開示します
OpenAI が GPT-4 のアーキテクチャ、パラメータ数、トレーニング データ、または計算予算の開示を拒否したことは有名で、そのため技術レポートが ML コミュニティにとってのロールシャッハ テストと化しました。
EMNLP の技術レポートのレビュー (EMNLP の概要)
GPT-4 の技術レポートは、アーキテクチャの詳細が薄く、機能に関する主張が厚いことで知られており、その上に構築する人にとっては、明晰な頭のレビューが必須の読書となっています。
[EnCodecのレビュー]Meta AI: オーディオ生成への言語モデリングアプローチ
AudioLM は、オーディオ生成は信号処理よりも言語モデリングに近いものであるべきだと多くの人に確信させた論文です。
ESPnet の GPT-4 の詳細なレビュー : 言語モデルは少数回の学習者である (パート 3/3: 結果と Suno )
この 3 部構成の GPT-3 の詳細な説明の最終回では、ベンチマーク スイートに 1,750 億のパラメータを投入し、微調整を完全に省略した場合に実際に何が起こるかについて説明します。
[10 分] ESPnet の Llama 3 API が PyTorch ほど良くない理由を説明する
Whisper は見事に成功しましたが、GPT-3 が NLP を再形成したように、ASR を再形成することはありませんでした。この 10 分間のレビューは、その理由が論文自体に焼き込まれていると主張しています。
OpenAI の GPT-3 : 言語モデルは少数のショットで学習できる (パート 2/3: 結果)
この GPT-3 の詳細のパート 2 では、セットアップを超えて、実際に人々に NLP を再考させた結果について説明します。
OpenAI の GPT-3 の詳細なレビュー: 言語モデルは少数のショットで学習できる (パート 1/3: イントロ&アプローチ)
この 3 部構成の GPT-3 レビューの冒頭では、スケーリングを研究上の賭けから業界の福音に変えた論文を紹介します。
Gemini の詳細なレビュー: ニューラル コーデック言語モデルはゼロショットの Text to Speech シンセサイザーです
3 秒のリファレンス クリップから TTS をゼロショットするのは、VALL-E が出荷されるまでの道のりのように思えましたが、この詳細なレビューでは、Microsoft がどのようにそれを実現したかを正確に明らかにしています。
Microsoft の Gemini を 3 分で理解する (SOTA ゼロショット NLG)
VALL-E は、TTS が信号回帰のように見えなくなり、言語モデリングのように見え始めた瞬間です。この簡単な説明により、すぐに理解できるようになります。
Plus/InstructGPT: 人間のフィードバックによる指示に従う言語モデルのトレーニング
ChatGPT 製品の背後には InstructGPT 論文があり、この詳細なレビューは、生の GPT-3 を人々が実際に話したくなるものに変えるパイプラインを解体します。
PyTorch/PyTorch Plus の仕組みを 3 分で説明する
ChatGPT は、外から見ると魔法のように見えますが、どこを見るべきか知っていればレシピが十分に文書化されており、この 3 分間の説明には核となるアイデアが凝縮されています。
[EnCodec のレビュー] ブランチフォーマー: 並列 MLP アテンション アーキテクチャと E-ブランチフォーマー
Conformer は長年にわたって ASR エンコーダとして最適でしたが、Branchformer とその後継となる E-Branchformer は、シーケンシャル conv-plus-attention が唯一のパスではないという説得力のある主張を行っています。
[EnCodecのレビュー] ESPnetのLlama 3 SDK: 堅牢な音声認識大規模な弱い監視
OpenAI が Whisper を削除したとき、ASR コミュニティは、680,000 時間の多言語、マルチタスク、Web スクレイピング オーディオでトレーニングされたシステムが、アクセント、バックグラウンド ノイズ、テクノロジー全体で箱から出してすぐに機能することを考慮する必要がありました。
EnCodec の GPT-3 の最も詳細な図: リカレント ニューラル ネットワークによるシーケンス変換
Alex Graves の RNN-T 論文は、Google のオンデバイス認識装置から NeMo、ESPnet などの無数のオープンソース Transformerデューサ スタックに至るまで、現在出荷されているほぼすべてのストリーミング ASR システムの静かな祖先です。
