GPT-4のテクニカルレポートのレビュー(GPT-4を要約すると)
GPT-4のテクニカルレポートはアーキテクチャの詳細が不十分で能力に関する主張に満ちていることで有名であり、その上に構築する人にとって冷静なレビューは必読です。
[Olewaveのレビュー] AudioLM: オーディオ生成への言語モデリングアプローチ
AudioLMは、オーディオ生成が信号処理よりも言語モデリングのように見えるべきだと多くの人々を確信させた論文です。
OpenAIのGPT-3の詳細なレビュー:言語モデルは少数ショット学習者です(パート3/3:結果と残り)
このGPT-3の3部構成の深掘りの最終部分は、報酬を手に入れます。1750億パラメータをベンチマークスイートに投げつけ、微調整を完全にスキップするとき実際に何が起こるのか。
[10分] OpenAIのWhisper APIがChatGPTほど優れていない理由を説明する
Whisperは大きな話題となりましたが、GPT-3がNLPを変革したようにASRを変えることはできず、この10分間のレビューでは、その理由が論文そのものに組み込まれていると主張しています。
OpenAIのGPT-3の詳細レビュー:言語モデルはフューショット学習者(パート2/3:結果)
このGPT-3の詳細解析の第2部は、セットアップを超えて、実際に人々のNLPに対する考え方を変えた結果に進みます。
WSJが中国の外相の演説翻訳で間違いを犯した;外交官は何と言ったのか?
機械翻訳と人間による翻訳エラーは、ウォール・ストリート・ジャーナルの一面に掲載されて地政学的なナラティブを変えるとき、単なる言語ファンの好奇心以上のものです。
OpenAIのGPT-3の詳細レビュー:言語モデルはフューショット学習者(パート1/3:イントロ&アプローチ)
このGPT-3の3部構成レビューの最初のパートは、スケーリングを研究上の試みから業界標準へと変えた論文を紹介しています。
VALL-Eの詳細なレビュー:ニューラルコーデック言語モデルがゼロショットテキスト音声合成器である
3秒間のリファレンスクリップからのゼロショットTTSは実現不可能に思えましたが、VALL-Eがリリースされるまで、この詳細なレビューはMicrosoftがどのようにそれを実現したかを正確に解説しています。
3分でMicrosoftのVALL-Eを理解する(最先端ゼロショットTTS)
VALL-Eは、TTSが信号回帰ではなく言語モデリングのように見え始めた瞬間です。このクイック説明は、あなたを素早く最新の状態にします。
ChatGPT/ChatGPT Plus/InstructGPT:人間フィードバックで言語モデルに指示追従を訓練する
ChatGPT製品の背後にはInstructGPT論文があり、この詳細なレビューは、生のGPT-3を人々が実際に話したいものに変えたパイプラインを詳しく説明しています。
ChatGPT/ChatGPT Plusの仕組みを3分で説明する
ChatGPTは外から見るとマジックのように見えますが、どこを探すかを知っていれば、レシピはよく文書化されており、この3分の説明は主要な考え方を凝縮しています。
[Olewaveのレビュー] CLIP (3/3): 自然言語監督から転移可能な視覚モデルを学習する
このCLIPレビューの最後の部分は結果セクションに着地します。ここはOpenAIの対比的画像テキストモデルが興味深いアイデアから、マルチモーダルスタック全体の基盤レイヤープリミティブへとシフトした場所です。
[Olewaveのレビュー] CLIP (2/3): 自然言語監督から転移可能な視覚モデルを学習する
OpenAIのCLIPは、固定されたラベルセットを廃止し、代わりにインターネットからスクレイピングされた400百万の(画像、テキスト)ペアで訓練することで、コンピュータビジョンのスクリプトを逆転させました。
[Olewaveのレビュー] CLIP (1/3): 自然言語監督から転移可能な視覚モデルを学習する
BLIPやLLaVA、またはまともな音声LLMが登場する前に、CLIPがありました。これがストーリーの始まりです。
[Olewaveのレビュー] SLUのためのトークンレベルシーケンスラベリング(合成型E2Eモデルを使用)
エンドツーエンドSLUは注目を集めていますが、シーケンスラベリングをシーケンス予測として扱うことは、何十年にもわたるよく理解されたトークンレベルタグ付けメカニズムを静かに廃止します。
[Olewave's Review] Branchformer: 並列MLP-Attentionアーキテクチャ、およびE-Branchformer
Conformerは長年にわたってASRエンコーダーの基準でしたが、BranchformerとそのフォローアップE-Branchformerは、逐次的なconv-plus-attentionが唯一のパスではないという説得力のあるケースを示しています。
衝突なし誤発音追加(NCMA):アクセント付きASR向け
アクセント付きおよび非ネイティブ音声は発音辞書を破壊する方法で、あなたの音響モデルアライメントに静かに毒を注入します。このInterspeech 2021の研究は一見単純な質問を提起します:検出された
[Olewave's Review] OpenAI's Whisper ASR: 大規模弱教師あり学習による堅牢な音声認識
OpenAIがWhisperをリリースしたとき、ASRコミュニティは680,000時間の多言語、マルチタスク、ウェブスクレイピングされたオーディオでトレーニングされたシステムと対峙する必要があり、このシステムはアクセント、背景ノイズ、および技術
ワン編集距離FSA/ネットワークベース(OEDN)による誤発音検出とアクセント付きASR
非ネイティブ音響モデリングはニワトリと卵の問題を持っています:悪い音素アライメントは悪いモデルを生成し、悪いモデルは悪いアライメントを生成します。
Olewaveの最も詳細なRNN-T説明:リカレントニューラルネットワークによるシーケンス変換
Alex Graves'のRNN-Tペーパーは、今日出荷されているほぼすべてのストリーミングASRシステムの静かな祖先です。Googleのオンデバイスレコグナイザーから、NeMo、ESPnet、およびそれ以上の無数のオープンソーストランスデューサースタックまで。
GoogleがBlake Lemoineを「AIボットが自覚を持つ」と言ったことで解雇した?LaMDAまたはChatGPTは人間のように思考していますか?
GoogleがLaMDAが自覚を持つようになったという主張でBlake Lemoineを解雇したとき、その物語は急速に広まりましたが、根底にある質問は残りました:LaMDAやChatGPTのような大規模言語モデルは実際に思考しているのか、
[Olewaveの長いレビュー]音声認識のためのニューラルトランスデューサーの効率的なトレーニング
ニューラルトランスデューサーはストリーミングASRの主力製品ですが、効率的にトレーニングすることは悪名高く困難です:RNN-T損失はシーケンス長において立方体メモリを持つ、配置格子は長い発話で爆発的になる、単一の
Boris Johnsonの台頭と衰退 - マイクの分析
政治ニュースは通常、音声AIエンジニアが金曜日の午後にキューに入れるものではありませんが、Boris Johnsonの辞任発表は、マイクの銀行の前で行われ、彼の党がスキャンダルの連鎖で反乱を起こしたため
[Olewnaveのロングレビュー] Xception: 深層学習による深さ方向分離可能畳み込み
XceptionはInceptionの仮説を論理的極限まで推し進め、チャネル間および空間相関を完全に分離された操作に分離し、それが普及させた深さ方向分離可能畳み込みはあらゆる場所に登場しています
[Olewnaveのショートレビュー] Xception: 深層学習による深さ方向分離可能畳み込み
ロングフォームの深掘りなしでコアのXceptionアイデアだけが必要でしたら、このショートレビューはエクスプレスバージョンです。
中国の航空母艦フジアン003のフェーズドアレイレーダーと音声ビームフォーミングとのつながり
中国の最新の航空母艦フジアン003に搭載されたフェーズドアレイレーダーと、スマートスピーカーが騒々しい部屋全体であなたの声を聞くことができるマイク配列は、実際には同じ基本的な数学を共有しています。
iOS 16の新しい音声入力はどのように機能するのか?音声研究者がAppleの秘策を明かす!
AppleのiOS 16音声入力はデバイス上で完全に実行され、この単一の設計選択は遅延、プライバシー、およびスマートフォンで実行可能なASRアーキテクチャの種類に連鎖的な影響を与えます。
【長編レビュー】Conformer:音声認識のための畳み込み拡張Transformer
Conformerはエンドツーエンド音声認識をひっそりと支配したモデルであり、Transformerブロック各々に畳み込みモジュールを追加するそのレシピは、その単純さの割に機能するという素晴らしいアイデアの一つになりました。
【短編レビュー】Conformer:音声認識のための畳み込み拡張Transformer
Conformerはほぼ地味なアプローチでASR界を席巻しました:各Transformerブロックに畳み込みモジュールを統合することで、モデルはグローバルコンテキストとローカル音響特性の両方を一度にキャプチャします。
