MetaのMovie Gen vs OpenAIのSora:詳細なレビュー
Metaはついに手札を見せました、そしてMovie Genはビデオジェネレーターだけではありません—複数のアスペクト比で1080p HDビデオを生成する基盤モデルの集合であり、同期オーディオをサポートし、プレ
Googleの研究者によるエンドツーエンド音声認識の深層分析、第1部:概要&モデリング
深層学習の10年間でASRワード誤り率を相対的に50%以上削減し、その過程でクラシックなHMMパイプラインを遺物のように見えるようにしました。
OpenAIのGPT-4oのニューラルネットワークアーキテクチャを推測する
OpenAIはGPT-4oに関する論文を公開していないため、このビデオは次善の対策を講じています。OpenAIが実際に実演した機能に基づいて、ニューラルネットワークアーキテクチャがほぼ確実にどのようなものであるかをリバースエンジニアリングしています。
GoogleのUniversal Speech Modelが100以上の言語でOpenAIのWhisper Modelを上回る
GoogleのUniversal Speech Modelは、標識付きトレーニングデータをほぼ7分の1しか使用しない状態で、100以上の言語においてASRでOpenAIのWhisper と同等かそれを上回る、という驚くべき成果を静かに達成しました。
OpenAI GPT-4のvision+textモデル、データ、および訓練コストの開示(推測)
OpenAIはGPT-4のアーキテクチャ、パラメータ数、訓練データ、または計算予算の開示を拒否したことで有名であり、これはテックレポートをMLコミュニティのロールシャッハテストにしてしまいました。
GPT-4のテクニカルレポートのレビュー(GPT-4を要約すると)
GPT-4のテクニカルレポートはアーキテクチャの詳細が不十分で能力に関する主張に満ちていることで有名であり、その上に構築する人にとって冷静なレビューは必読です。
[Olewaveのレビュー] AudioLM: オーディオ生成への言語モデリングアプローチ
AudioLMは、オーディオ生成が信号処理よりも言語モデリングのように見えるべきだと多くの人々を確信させた論文です。
OpenAIのGPT-3の詳細なレビュー:言語モデルは少数ショット学習者です(パート3/3:結果と残り)
このGPT-3の3部構成の深掘りの最終部分は、報酬を手に入れます。1750億パラメータをベンチマークスイートに投げつけ、微調整を完全にスキップするとき実際に何が起こるのか。
[10分] OpenAIのWhisper APIがChatGPTほど優れていない理由を説明する
Whisperは大きな話題となりましたが、GPT-3がNLPを変革したようにASRを変えることはできず、この10分間のレビューでは、その理由が論文そのものに組み込まれていると主張しています。
OpenAIのGPT-3の詳細レビュー:言語モデルはフューショット学習者(パート2/3:結果)
このGPT-3の詳細解析の第2部は、セットアップを超えて、実際に人々のNLPに対する考え方を変えた結果に進みます。
OpenAIのGPT-3の詳細レビュー:言語モデルはフューショット学習者(パート1/3:イントロ&アプローチ)
このGPT-3の3部構成レビューの最初のパートは、スケーリングを研究上の試みから業界標準へと変えた論文を紹介しています。
ChatGPT/ChatGPT Plus/InstructGPT:人間フィードバックで言語モデルに指示追従を訓練する
ChatGPT製品の背後にはInstructGPT論文があり、この詳細なレビューは、生のGPT-3を人々が実際に話したいものに変えたパイプラインを詳しく説明しています。
ChatGPT/ChatGPT Plusの仕組みを3分で説明する
ChatGPTは外から見るとマジックのように見えますが、どこを探すかを知っていれば、レシピはよく文書化されており、この3分の説明は主要な考え方を凝縮しています。
[Olewaveのレビュー] CLIP (3/3): 自然言語監督から転移可能な視覚モデルを学習する
このCLIPレビューの最後の部分は結果セクションに着地します。ここはOpenAIの対比的画像テキストモデルが興味深いアイデアから、マルチモーダルスタック全体の基盤レイヤープリミティブへとシフトした場所です。
[Olewaveのレビュー] CLIP (2/3): 自然言語監督から転移可能な視覚モデルを学習する
OpenAIのCLIPは、固定されたラベルセットを廃止し、代わりにインターネットからスクレイピングされた400百万の(画像、テキスト)ペアで訓練することで、コンピュータビジョンのスクリプトを逆転させました。
[Olewaveのレビュー] CLIP (1/3): 自然言語監督から転移可能な視覚モデルを学習する
BLIPやLLaVA、またはまともな音声LLMが登場する前に、CLIPがありました。これがストーリーの始まりです。
[Olewave's Review] OpenAI's Whisper ASR: 大規模弱教師あり学習による堅牢な音声認識
OpenAIがWhisperをリリースしたとき、ASRコミュニティは680,000時間の多言語、マルチタスク、ウェブスクレイピングされたオーディオでトレーニングされたシステムと対峙する必要があり、このシステムはアクセント、背景ノイズ、および技術
[ロングレビュー] 高忠実度画像生成のためのカスケード型拡散モデル
ImagenとDALL-E 2が拡散を生成画像の標準にする前に、このGoogle Brainの論文は、その後の多くのテキスト・ツー・イメージシステムが静かに借用したカスケード型拡散のレシピを示しました:小さなもので始める
[ショートレビュー] 高忠実度画像生成のためのカスケード型拡散モデル
カスケード型拡散は多くの最新の生成的作業の基礎となる2段階以上のレシピです:1つの拡散モデルで小さな画像を生成し、その後、高周波詳細を追加する超解像拡散モデルに渡します
