Deduct OpenAI GPT-4o's Neural Network Architecture

Tutorials

استنتاج معمارية الشبكة العصبية لـ OpenAI GPT-4o

لم تنشر OpenAI ورقة عن GPT-4o، لذا يفعل هذا الفيديو الشيء التالي الأفضل: فهو يقوم بهندسة عكسية لمعمارية الشبكة العصبية التي تبدو أنها بالتأكيد ستكون بناءً على القدرات التي أظهرتها OpenAI بالفعل

لم تنشر OpenAI ورقة عن GPT-4o، لذا يفعل هذا الفيديو الشيء التالي الأفضل: فهو يقوم بهندسة عكسية لمعمارية الشبكة العصبية التي تبدو أنها بالتأكيد ستكون بناءً على القدرات التي أظهرتها OpenAI بالفعل. الأدلة الأولية مذهلة — أوقات استجابة صوتية بمدة 232 ميلي ثانية (أساساً زمن انتقال محادثة بشرية)، استدلال مشترك عبر النص والصوت والصورة والفيديو في نموذج موحد واحد، وأسعار API أرخص بنسبة 50٪ من GPT-4 Turbo مع فهم نصي ورؤية وسمعي متعدد اللغات أفضل بشكل كبير. حدث شيء هيكلي تحت الغطاء، وبوضوح لم يكن مجرد ضبط دقيق لـ GPT-4.

يسير التحليل عبر ما يتطلبه نموذج موحد واحد يتعامل مع إدخال وإخراج شامل حقاً: كيف يتجاوز الصوت على الأرجح الأنبوب الكلاسيكي Whisper-زائد-LLM-زائد-TTS الذي أجهز على زمن الانتقال الصوتي في وضع ChatGPT Voice Mode الأقدم، ما هي خيارات الترميز والتضمين التي تجعل الاستجابات عبر الأشكال المشروطة تحت الثانية ممكنة، وأين غالباً ما تستعير GPT-4o من بحث OpenAI Whisper و Voice Engine والرؤية بالإضافة إلى العمل المجاور مثل Project Astra من Google. إذا كنت تصمم أنظمة شاملة للأشكال المتعددة أو تحاول فهم سبب اختلاف تفاعل الصوت في GPT-4o بشكل جذري عن خطوط الأنابيب المخيطة معاً التي جاءت قبله، اضغط على التشغيل لخصم المعمارية.