Deduct OpenAI GPT-4o's Neural Network Architecture

Tutorials

OpenAIのGPT-4oのニューラルネットワークアーキテクチャを推測する

OpenAIはGPT-4oに関する論文を公開していないため、このビデオは次善の対策を講じています。OpenAIが実際に実演した機能に基づいて、ニューラルネットワークアーキテクチャがほぼ確実にどのようなものであるかをリバースエンジニアリングしています。

OpenAIはGPT-4oに関する論文を公開していないため、このビデオは次善の対策を講じています。OpenAIが実際に実演した機能に基づいて、ニューラルネットワークアーキテクチャがほぼ確実にどのようなものであるかをリバースエンジニアリングしています。最初の証拠は印象的です。232msのオーディオレスポンスタイム(基本的に人間的な会話レイテンシー)、単一の統合モデル内でのテキスト、オーディオ、画像、ビデオ間の共同推論、そしてGPT-4 Turboより50%安いAPI価格で、より優れた多言語テキスト、ビジョン、オーディオ理解を備えています。何か構造的な変化が内部で起こり、それはGPT-4の単なるファインチューンではなかったことは明らかです。

この分析は、マルチモーダル入出力を処理する単一の統合モデルが妥当に必要とするもの、オーディオが旧ChatGPT Voice Modeでボイスレイテンシーを殺していた古典的なWhisper-plus-LLM-plus-TTSパイプラインをどのようにバイパスするかもしれない、トークン化と埋め込み選択がサブセカンドのクロスモーダルレスポンスをどのように実現可能にするか、そしてGPT-4oがOpenAIのWhisper、Voice Engine、ビジョン研究、およびGoogle's Project Astraのような隣接する作業をおそらくどこから借りているかについて説明しています。マルチモーダルシステムを設計しているか、GPT-4oの音声対話がそれ以前のつぎはぎされたパイプラインとカテゴリー的に異なることを理解しようとしているなら、建築推測のために再生を押してください。