LoRA: allow a high school student to train Large Language Model (GPT-3) with a gaming graphics card

Tutorials

LoRA: السماح لطالب في المدرسة الثانوية بتدريب نموذج اللغة الكبيرة (GPT-3) بطاقة رسومات ألعاب

الضبط الدقيق الكامل لـ GPT-3 بـ 175 مليار معامل هو نقطة عدم البدء لجميع الناس تقريبًا — التخزين وحده يستبعده، ناهيك عن بطاقات الرسومات.

الضبط الدقيق الكامل لـ GPT-3 بـ 175 مليار معامل هو نقطة عدم البدء لجميع الناس تقريبًا — التخزين وحده يستبعده، ناهيك عن بطاقات الرسومات. LoRA (تكيف منخفض الرتبة) هي التقنية من Microsoft Research التي جعلت بهدوء تخصيص LLM قابلاً للتتبع بالنسبة لنا. إنها تجمد الأوزان المسبقة وتحقن مصفوفات تحلل الرتبة القابلة للتدريب الصغيرة في كل طبقة Transformer، مما يقلل من معاملات القابلة للتدريب بما يصل إلى 10000 مرة وذاكرة GPU بمقدار 3 مرات مع مطابقة أو تجاوز جودة الضبط الدقيق الكامل.

تشرح هذه الجولة سبب عمل LoRA — نقص الرتبة التجريبي لمصفوفات التحديث أثناء التكيف — وسبب تفوقها على المحولات بطريقة حاسمة: يمكن دمج مصفوفات الرتبة المنخفضة مرة أخرى في الأوزان الأساسية في وقت الاستدلال، لذا لا توجد زمن كمون مضافة. تغطي النتائج عبر RoBERTa و DeBERTa و GPT-2 و GPT-3 إلى جانب الفوائد العملية: يمكنك الآن بشكل واقعي ضبط نماذج كبيرة على بطاقة رسومات مستهلك واحدة، وتبديل المحولات الخاصة بالمهام في وقت التشغيل، وشحنها كملفات صغيرة. إذا كنت قد استخدمت مكتبة PEFT من HuggingFace دون فهم كامل لما تفعله LoRA تحت الغطاء، فهذا الغوص العميق هو ما يصلح ذلك.