博士大叔使用计算机作弊降维打击2022高考数学压轴大题 Ph.D. يستخدم الحاسوب للغش في حل امتحان رياضيات gaokao 2022
ماذا يحدث عندما تطلق مجموعة أدوات جبر حاسوبية من مستوى البحث على أصعب مسألة في امتحان gaokao للرياضيات 2022؟
[Long Review] نماذج الانتشار المتسلسلة لتوليد الصور عالية الدقة
قبل أن تجعل Imagen و DALL-E 2 الانتشار المعيار الافتراضي لتوليد الصور، وضعت ورقة Google Brain وصفة الانتشار المتسلسلة التي استعارتها الكثير من الأنظمة النصية إ…
[Short Review] نماذج الانتشار المتسلسلة لتوليد الصور عالية الدقة
الانتشار المتسلسل هو وصفة من مرحلتين فما فوق تحت الكثير من العمل التوليدي الحديث: توليد صورة صغيرة بنموذج انتشار واحد، ثم تسليمها إلى نماذج انتشار عالية الدقة …
[Long Review] الانتباه المحوري في المحولات متعددة الأبعاد
الانتباه الذاتي الكامل على صورة أو فيديو مكلف للغاية، فكيف تحافظ على التعبيرية للمحول بدون الانفجار التربيعي؟
[Short Review] الانتباه المحوري في المحولات متعددة الأبعاد
الانتباه المحوري هو أحد تلك الأفكار الأنيقة التي تحافظ على المحولات قابلة للتعامل معها على البيانات عالية الأبعاد: بدلاً من الانتباه على كل بكسل أو كل صندوق وقت…
[مراجعة طويلة] نقل التعلم من التحقق من المتحدث إلى تحويل النص إلى كلام متعدد المتحدثين
هذه هي الورقة التي جعلت استنساخ الصوت بدون أمثلة عملياً: قم بتدريب مشفر المتحدث على مهمة التحقق التمييزية باستخدام آلاف الأصوات الضاخة والخالية من النصوص، ثم أد…
[مراجعة قصيرة] نقل التعلم من التحقق من المتحدث إلى تحويل النص إلى كلام متعدد المتحدثين
ورقة Google التي بدأت موجة استنساخ الصوت الحديثة بدون أمثلة لديها بنية نظيفة وجميلة: مشفر متحدث مدرب على التحقق، محلل Tacotron 2 الذي يحول النص بالإضافة إلى تض…
[مراجعة طويلة] Wav2Seq: نماذج مشفر-فاك مدرب مسبقاً للكلام إلى نص باستخدام لغات وهمية
ركزت معظم طرق التدريب المسبق للكلام على جانب المشفر، wav2vec و HuBERT و WavLM، لكن ASR من تسلسل إلى تسلسل يحتاج أيضاً إلى فاك مدرب مسبقاً.
[مراجعة قصيرة] Wav2Seq: نماذج مشفر-فاك مدرب مسبقاً للكلام إلى نص باستخدام لغات وهمية
وفر التدريب المسبق غير الخاضع للإشراف مثل wav2vec 2.0 مشفرات كلام ممتازة لنا، لكن بالنسبة لنظام ASR كامل مشفر-فاك، كان الفاك لا يزال يبدأ من الصفر.
[Long Review] نحو التعلم اللغوي بدون تسميات
ماذا لو كان بإمكانك تدريب نماذج NLP خاصة بمهام محددة دون مثال واحد مسمى من قبل البشر؟ "نحو التعلم اللغوي بدون تسميات" يركز بشدة على هذا السؤال.
[Short Review] نحو التعلم اللغوي بدون تسميات
ماذا لو أن البيانات المسماة التي قضيت أشهراً في شرحها لم تكن ضرورية على الإطلاق؟
[Long Review] Fully Sharded Data Parallel: تدريب ذكاء اصطناعي أسرع مع معالجات رسوميات أقل
كان تدريب نموذج كلام أو لغة ذو مليار معامل على ميزانية GPU متواضعة يعني الاختيار بين التوازي في خط الأنابيب أو التوازي الموتري أو تجزئة المحسن من نمط ZeRO.
[Short Review] Fully Sharded Data Parallel: تدريب ذكاء اصطناعي أسرع مع معالجات رسوميات أقل
Fully Sharded Data Parallel هي إجابة Meta على سؤال تسأله كل فريق كلام ولغة في النهاية: كيف نقوم بتدريب نماذج أكبر بكثير دون الحاجة إلى معالجات رسوميات أكثر بكث…
[مراجعة طويلة] إلغاء تكرار بيانات التدريب يجعل نماذج اللغة أفضل
يبدو إلغاء التكرار ممل حتى تتعلم أن جملة واحدة من 61 كلمة تظهر أكثر من 60,000 مرة داخل C4، وأن نماذج اللغة المدربة على مثل هذه المجموعات تعيد نص بيانات التدريب…
[مراجعة قصيرة] إلغاء تكرار بيانات التدريب يجعل نماذج اللغة أفضل
كم من "التعميم" في نموذج اللغة الخاص بك هو في الواقع مجرد إعادة إنتاج؟
[مراجعة طويلة] CLAS: السياق العميق: التعرف على الكلام السياقي من طرف إلى طرف
أي شخص أطلق منتج ASR يعرف صعوبة الأسماء العلمية: أسماء جهات الاتصال، عناوين الأغاني، أسماء الأدوية، أسماء الأماكن الغامضة.
[مراجعة طويلة] العقبات في التقدم في الإجابة على الأسئلة الطويلة
الإجابة على الأسئلة الطويلة هي أحد تلك المعايير التي تبدو مثيرة للإعجاب على لوحة التصنيف ومقلقة تحت المجهر.
[مراجعة طويلة] نماذج اللغات المدربة بالضبط هي متعلمون بدون لقطات صفرية
قبل أن يجعل InstructGPT ضبط التعليمات عبارة شائعة، قدمت ورقة FLAN من Google الحالة بأن قدراً متواضعاً من الضبط الدقيق متعدد المهام على تعليمات اللغة الطبيعية يمك…
[مراجعة طويلة] 'GShard': توسيع النماذج الضخمة باستخدام الحساب الشرطي والتقسيم التلقائي
يصبح توسيع Transformer بعد مائة مليار معامل فلسفياً بسرعة: هل تقوم بتنشيط الشبكة بأكملها لكل رمز، أم توجه كل رمز إلى المتخصصين الذين يحتاجون فعلاً إلى رؤيته؟
متزلجو الأرقام الروسيون مثل التوائم الثلاثية: هل يمكن استخدام Kullback-Leibler Divergence لتمييز الفرق بينهم؟
تكييف المتحدث هو أحد تلك مشاكل ASR التي تبدو محلولة حتى تحاول فعلاً تكييف نموذج sequence-to-sequence دون تدمير التمثيلات الصوتية الصعبة المكتسبة للمشفر.
هل يتم تسجيل 4 Flip الخاص بـ Nathan Chen بواسطة Mixture-of-Experts؟ الجزء 1: Switch Transformers: نماذج MoE المتفرقة
تم تأطيره برمزة إلى Nathan Chen's quad flip scoring، تتناول هذه المحادثة Switch Transformer، تفسير Google النظيف والمبسط بعدوانية لتوسيع Mixture-of-Experts.
هل يتم تسجيل قلبة ناثان تشن الرباعية بواسطة Mixture-of-Experts؟ الجزء 2: GLaM: قياس فعال للنماذج اللغوية مع MoE
الجزء 2 من سلسلة MoE المصغرة ينتقل إلى GLaM، نموذج اللغة Mixture-of-Experts من Google الذي يحتوي على 1.2 تريليون معامل والذي يطابق أو يتفوق على GPT-3 في معايير…
ورقة BERT تمت مراجعتها من منظور الكلام
BERT بالكاد يحتاج إلى مقدمة في NLP، لكن قراءتها من خلال عيون مهندس الكلام تكشف مجموعة مختلفة من الدروس عن الملخص القياسي "نمذجة اللغة المقنعة غيرت كل شيء".
Transformer: الانتباه هو كل ما تحتاجه و Listen, Attend and Spell - من منظور الكلام
ورقتان، قصة واحدة. "Attention Is All You Need" أعطت العالم Transformer وأعادت تعيين كيفية عمل نمذجة التسلسل، بينما قامت "Listen, Attend and Spell" (LAS) بنفس ا…
من Breaking Bad إلى Wav2vec 2.0: إطار عمل للتعلم ذاتي الإشراف لتمثيلات الكلام
ما الذي يجمع بين Walter White و Jesse Pinkman ودفعة من الصوت غير المسمى؟
HuBERT: تعلم التمثيل الكلامي ذاتي الإشراف من خلال التنبؤ المقنع بالوحدات المخفية
غيّرت wav2vec 2.0 قواعد اللعبة بالإشراف الذاتي التباعدي، لكن HuBERT طرح سؤالاً أكثر حدة: ماذا لو تجاوزنا خدعة التباعد كلياً وقمنا فقط بالتنبؤ المقنع على غرار BERT…
W2v-BERT: دمج التعلم التباعدي والنمذجة اللغوية المقنعة للإشراف الذاتي
لماذا تختار بين التعلم التباعدي والنمذجة اللغوية المقنعة للتدريب المسبق للكلام عندما يمكنك ربط كليهما في نفس الشبكة؟
استكشاف ضبط Wav2vec 2.0 الدقيق لتحسين التعرف على المشاعر الكلامية
لطالما كان التعرف على المشاعر الكلامية عالقاً مع مجموعات بيانات صغيرة مُحددة والميزات الصوتية المصنوعة يدويّاً.
التدريب المشترك بدون إشراف وبإشراف للتعرف التلقائي على الكلام متعدد اللغات
أصبح التدريب المسبق ثم الضبط الدقيق هو الوصفة الافتراضية للتعرف التلقائي على الكلام متعدد اللغات، لكنه يترك الكثير على الطاولة: المرحلتان لا تتشاركان الخسائر، …
WavLM: التدريب المسبق ذاتي الإشراف على نطاق واسع لمعالجة الكلام الشاملة
معظم نماذج SSL للكلام تحسّن من أجل ASR وتأمل أن ينجح كل شيء آخر.
