[Long Review] Towards Zero-Label Language Learning

Tutorials

[مراجعة طويلة] نحو تعلم اللغة بدون علامة تجارية

ماذا لو كان بإمكانك تدريب نماذج NLP الخاصة بمهمة محددة دون مثال واحد مسمى بواسطة الإنسان؟ يميل كتاب "نحو تعلم اللغة بدون علامة تجارية" بشدة إلى هذا السؤال.

ماذا لو كان بإمكانك تدريب نماذج NLP الخاصة بمهمة محددة دون مثال واحد مسمى بواسطة الإنسان؟ يميل كتاب "نحو تعلم اللغة بدون علامة تجارية" بشدة إلى هذا السؤال. الحيلة هي إنشاء البيانات غير الخاضعة للرقابة (UDG)، والتي تستخدم مطالبات قليلة على نموذج لغة كبير تم تدريبه مسبقًا مثل GPT-3 لتجميع مجموعة التدريب الخاصة بها، ثم ضبط النموذج النهائي على تلك البيانات الاصطناعية فقط.

تتجول هذه المراجعة الطويلة عبر خط أنابيب UDG بالتفصيل ونتائجها المدهشة: النماذج التي تم تدريبها فقط على البيانات الاصطناعية تتطابق أو تتفوق على خطوط الأساس المدربة على التعليقات التوضيحية البشرية الحقيقية، وعندما تقوم بخلط البيانات الاصطناعية مع البيانات المصنفة كتعزيز، فإن النهج يضع أرقامًا جديدة على أحدث طراز على SuperGLUE. بالنسبة لفرق الذكاء الاصطناعي للكلام والصوت، تكون الآثار مباشرة، وهذا هو دليل التشغيل الخاص بالتسميات التمهيدية لتصنيف الأغراض، والتحليل الدلالي، وأي مهمة NLU النهائية حيث يكون التعليق التوضيحي البشري هو عنق الزجاجة. تتعمق في كل قطعة إذا كنت تخطط لخط أنابيب البيانات الاصطناعية التالي.