[Short Review] Fully Sharded Data Parallel: faster AI training with fewer GPUs

Tutorials

[مراجعة قصيرة] البيانات المتوازية بالكامل: تدريب أسرع للذكاء الاصطناعي مع عدد أقل من وحدات معالجة الرسومات

البيانات المتوازية بالكامل هي إجابة Meta على سؤال يطرحه كل فريق من فرق الكلام واللغة في النهاية: كيف ندرب النماذج بترتيب أكبر من حيث الحجم دون توفير عدد أكبر من وحدات معالجة الرسومات؟

البيانات المتوازية بالكامل هي إجابة Meta على سؤال يطرحه كل فريق من فرق الكلام واللغة في النهاية: كيف ندرب النماذج بترتيب أكبر من حيث الحجم دون توفير عدد أكبر من وحدات معالجة الرسومات؟ يقوم FSDP بتقسيم معلمات النموذج عبر العاملين المتوازيين للبيانات، ويحافظ على كل حساب microbatch محليًا، ويمتد بشكل اختياري إلى CPU عندما تصبح ذاكرة GPU ضعيفة. نظرًا لأن التجزئة موحدة ويتداخل الاتصال مع العمليات الحسابية، تظل الإنتاجية قادرة على المنافسة مع توازي خطوط الأنابيب المضبوطة يدويًا بينما يظل النموذج العقلي بسيطًا بشكل منعش.

توضح هذه المراجعة القصيرة تطبيق FairScale وانتصاراته المبكرة على NLP الداخلي لفيسبوك وأعباء عمل الرؤية. بالنسبة لمهندسي الذكاء الاصطناعي الصوتي الذين يدفعون wav2vec 2.0 أو HuBERT أو TTS المستند إلى LLM نحو نطاق أوسع، فإن FSDP هو مسار ترقية منخفض الاحتكاك مع توفير حقيقي للذاكرة خلفه. اضغط على تشغيل للقيام بجولة سريعة حول ما يفعله FSDP ولماذا من المحتمل أن يكون هو الإعداد الافتراضي بالفعل في تكوين تدريب PyTorch التالي.