The Secret That Made Claude 3 Trump GPT-4

Tutorials

السر الذي جعل Claude 3 يتفوق على GPT-4

عندما تفوق Claude 3 Opus على GPT-4 في MMLU و GPQA و GSM8K ومعظم مقاييس التقييم الحدودية، لم يكن السؤال المثير للاهتمام هو ما إذا كانت Anthropic قد قامت ببساطة بتوسيع أكثر — بل ما هي صيغة السر في وقت التدريب

عندما تفوق Claude 3 Opus على GPT-4 في MMLU و GPQA و GSM8K ومعظم مقاييس التقييم الحدودية، لم يكن السؤال المثير للاهتمام هو ما إذا كانت Anthropic قد قامت ببساطة بتوسيع أكثر — بل ما هي صيغة السر في وقت التدريب التي نالتها فعلاً. هذه المراجعة تفكك تقرير Claude 3 الفني الذي يغطي Opus و Sonnet و Haiku، والأهم من ذلك تحفر في الخوارزمية الأساسية وراء stack المحاذاة من Anthropic: Constitutional AI و حلقة تدريب RLAIF التي تحركها.

يغطي الشرح ما الذي يجعل Claude 3 يعمل عبر ثلاث طبقات قدرات، لماذا تم تصميم العائلة بقصد حول المقايضة بين الذكاء والسرعة والتكلفة بدلاً من نموذج رائد واحد، وكيف يتجنب RLAIF — التعلم بالتعزيز من التغذية الراجعة للذكاء الاصطناعي الموجهة برستور مكتوب — بعض الاختناقات الحجمية للـ RLHF النقي الذي يعتمد على المصنفين البشريين. توقع أن تخرج برصورة أوضح لماذا يتم توسيع النهج الدستوري بشكل مختلف، كيف يحرك التحسينات في التحليل والتنبؤ وتوليد الأكواد واللغات غير الإنجليزية، وما تعنيه لأي شخص يحاول بناء نموذج محاذي مماثل. إذا كنت تتتبع سباق LLM الحدودي بعيداً عن مخططات المقاييس، فهذه خمس دقائق قوية.