مراجعة التقرير الفني لـ GPT-4 (GPT-4 بإيجاز)
يشتهر التقرير التقني لـ GPT-4 بأنه يفتقر إلى تفاصيل الهندسة المعمارية ويركز بشكل كبير على مطالبات الإمكانيات، مما يجعل المراجعة الموضوعية قراءة ضرورية لأي شخص …
[مراجعة Olewave] AudioLM: نهج لنمذجة اللغة لتوليد الصوت
AudioLM هي الورقة البحثية التي أقنعت الكثيرين بأن توليد الصوت يجب أن يبدو أكثر مثل نمذجة اللغة من معالجة الإشارات.
مراجعة متعمقة لـ GPT-3 من OpenAI: Language Models are Few-Shot Learners (الجزء 3/3: النتائج والبقية)
يصل الجزء الأخير من هذا الفحص العميق لـ GPT-3 ذي الثلاثة أجزاء إلى النقطة المهمة: ماذا يحدث بالفعل عندما تطبق 175 مليار معامل على مجموعة المعايير وتتجاوز الضبط…
[10 mins] اشرح لماذا Whisper API من OpenAI ليس جيدًا مثل ChatGPT
حقق Whisper نجاحًا كبيرًا، لكنه لم يعيد تشكيل ASR بالطريقة التي أعادت بها GPT-3 تشكيل NLP، وتجادل هذه المراجعة لمدة عشر دقائق بأن الأسباب مدمجة في الورقة البحثية…
مراجعة متعمقة في GPT-3 من OpenAI: نماذج اللغة تتعلم من عينات قليلة (الجزء 2/3: النتائج)
ينتقل الجزء الثاني من هذا الغوص العميق في GPT-3 بعد الإعداد إلى النتائج التي جعلت الناس فعلاً يعيدون التفكير في NLP.
أخطأت WSJ في ترجمة خطاب وزير الخارجية الصيني؛ ماذا قال الدبلوماسي بالفعل؟
أخطاء الترجمة الآلية والبشرية أكثر من مجرد فضول لغوي عندما تظهر على الصفحة الأولى من Wall Street Journal وتعيد تشكيل الروايات الجيوسياسية.
مراجعة متعمقة في GPT-3 من OpenAI: نماذج اللغة تتعلم من عينات قليلة (الجزء 1/3: المقدمة والنهج)
يعرض الجزء الأول من هذه المراجعة الثلاثية الأجزاء لـ GPT-3 الورقة التي حولت التوسع من رهان بحثي إلى حقيقة مسلمة في الصناعة.
مراجعة متعمقة لـ VALL-E: نماذج ترميز اللغة العصبية هي مركبات نص إلى كلام بدون عينة
بدت فكرة نقل TTS بدون عينة من مقطع مرجعي مدته ثلاث ثواني بعيدة المنال حتى وصلت VALL-E، وتفكك هذه المراجعة المتعمقة بالضبط كيفية تحقيق Microsoft لذلك.
فهم VALL-E من Microsoft في 3 دقائق (SOTA Zero-shot TTS)
VALL-E هي اللحظة التي توقف فيها TTS عن الظهور مثل انحدار الإشارة وبدأ يبدو مثل نمذجة اللغة، وهذا الشارح السريع يسرع لك الوصول بسرعة.
ChatGPT/ChatGPT Plus/InstructGPT: تدريب نماذج اللغة على متابعة التعليمات برد فعل بشري
خلف منتج ChatGPT تقف ورقة InstructGPT، وتفكك هذه المراجعة المفصلة خط الأنابيب الذي حول GPT-3 الخام إلى شيء يريد الناس فعلاً التحدث معه.
شرح كيفية عمل ChatGPT/ChatGPT Plus في 3 دقائق
يبدو ChatGPT وكأنه سحر من الخارج، لكن الوصفة موثقة جيداً إذا كنت تعرف أين تبحث، وهذا الشارح لمدة ثلاث دقائق يكثف الأفكار الأساسية.
[Olewave's Review] CLIP (3/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
يقع الجزء الأخير من هذا الاستعراض CLIP في قسم النتائج، وهو حيث حول نموذج OpenAI المقابل للصور والنصوص من فكرة مثيرة للاهتمام إلى عنصر بدائي على مستوى الأساس لم…
[Olewave's Review] CLIP (2/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
قلبت CLIP من OpenAI مسار الرؤية الحاسوبية بالتخلص من مجموعات التسميات الثابتة والتدريب بدلاً من ذلك على 400 مليون زوج (صور، نصوص) مكشوطة من الإنترنت.
[Olewave's Review] CLIP (1/3): تعلم النماذج البصرية القابلة للنقل من الإشراف باللغة الطبيعية
قبل أن يكون هناك BLIP أو LLaVA أو أي speech-LLM جدير بالاهتمام، كان CLIP موجوداً، وهنا حيث تبدأ القصة.
[Olewave's Review] وسم المتسلسلات على مستوى الرمز لـ SLU باستخدام نماذج E2E التركيبية
يشهد SLU الشامل رواجاً الآن، لكن معاملة وسم المتسلسلات كتنبؤ متسلسل ترمي بعيداً بصمت عقوداً من آلية الوسم المعروفة جيداً على مستوى الرمز.
[مراجعة Olewave] Branchformer: معماريات MLP-Attention المتوازية، و E-Branchformer
كان Conformer هو مشفر ASR الذي يجب التغلب عليه لسنوات، لكن Branchformer و تابعه E-Branchformer يقدمان حالة مقنعة بأن sequential conv-plus-attention ليس هو المس…
إضافة عدم التصادم في الأخطاء اللفظية (NCMA) للتعرف على الكلام باللهجة
كلام بلهجة والكلام غير الأصلي يكسران قاموس النطق بطرق تسمم بهدوء محاذاة نموذجك الصوتي، وهذا البحث من Interspeech 2021 يطرح سؤالاً بسيطاً ظاهرياً: ماذا لو أضفنا فقط
[مراجعة Olewave] Whisper ASR من OpenAI: التعرف المتين على الكلام من خلال الإشراف الضعيف على نطاق واسع
عندما أطلقت OpenAI Whisper، اضطر مجتمع ASR للتعامل مع نظام تم تدريبه على 680,000 ساعة من الصوت متعدد اللغات ومتعدد المهام ومجمع من الويب، وقد عمل بشكل جيد مباش…
واحد-تحرير-مسافة FSA/Network-based (OEDN) في كشف الأخطاء اللفظية والتعرف على الكلام باللهجة
تحتوي النمذجة الصوتية غير الأصلية على مشكلة الدجاجة والبيضة: محاذاات الهاتف السيئة تنتج نماذج سيئة، والنماذج السيئة تنتج محاذاات سيئة.
أكثر توضيح تفصيلي من Olewave لـ RNN-T: Sequence Transduction with Recurrent Neural Networks
ورقة RNN-T الخاصة بـ Alex Graves هي السلف الهادئ لكل نظام ASR للبث يتم شحنه اليوم، من معرف Google على الجهاز إلى عدد لا يحصى من مكدسات transducer مفتوحة المصدر…
هل أطلقت Google النار على Blake Lemoine لقوله إن روبوت الذكاء الاصطناعي واعٍ؟ هل يفكر LaMDA أو ChatGPT مثل الإنسان؟
عندما أطلقت Google النار على Blake Lemoine لإعلانه علنًا عن ادعاءات بأن LaMDA أصبح واعيًا، انتشرت القصة بسرعة، لكن السؤال الأساسي ظل قائمًا: هل نماذج اللغات الكبي…
[مراجعة Olewave الطويلة] التدريب الفعّال لـ Neural Transducer للتعرف على الكلام
محولات Neural هي حصان العمل في ASR للبث، لكن تدريبها بكفاءة مشهور بأنه مؤلم: خسارة RNN-T لديها ذاكرة مكعبة في طول التسلسل، وشبكة المحاذاة تنفجر على الكلام الطو…
ارتفاع وسقوط Boris Johnson - تحليل الميكروفونات
الأخبار السياسية عادة ليست ما يشغله مهندسو صوت الذكاء الاصطناعي ليوم الجمعة بعد الظهر، لكن إعلان استقالة Boris Johnson، الذي تم إلقاؤه أمام مصفوفة من الميكروفو…
[Olewave's Long Review] Xception: التعلم العميق مع Depthwise Separable Convolutions
أخذ Xception فرضية Inception إلى أقصاها المنطقي بدفع الارتباطات عبر القنوات والمكانية إلى عمليات منفصلة تماماً، والتحويلات Depthwise Separable التي روّجت لها تظه…
[Olewave's Short Review] Xception: التعلم العميق مع Depthwise Separable Convolutions
إذا كنت تريد فكرة Xception الأساسية فقط بدون الغوص العميق الطويل، فهذه المراجعة القصيرة هي النسخة السريعة.
رادار المصفوفة المرحلية على حاملة الطائرات الصينية Fujian 003 وصلتها بتشكيل شعاع الكلام
مصفوفة الرادار المرحلية المثبتة على أحدث حاملة طائرات صينية، Fujian 003، ومصفوفات الميكروفون التي تسمح لمكبر الصوت الذكي الخاص بك بسماعك عبر غرفة صاخبة تشترك ف…
كيف يعمل الإملاء الجديد تماماً في iOS 16؟ كشف الصيغة السرية لشركة Apple من قبل باحث الكلام!
يعمل الإملاء في iOS 16 من Apple بالكامل على الجهاز، وهذا الخيار التصميمي الوحيد له تداعيات متسلسلة على الكمون والخصوصية، وأنواع معماريات ASR التي تكون قابلة لل…
[مراجعة طويلة] Conformer: Transformer معزز بالالتفاف للتعرف على الكلام
Conformer هو النموذج الذي استحوذ بهدوء على ASR من النهاية إلى النهاية، وصيغته، وضع وحدة التفاف على كل كتلة Transformer، تبين أنها واحدة من تلك الأفكار البسيطة …
[مراجعة قصيرة] Conformer: Transformer معزز بالالتفاف للتعرف على الكلام
استحوذ Conformer على عالم ASR بقوة عاصفة بفعل شيء بسيط تقريباً: إضافة وحدة التفاف إلى كل كتلة Transformer بحيث يلتقط النموذج السياق العام والتفاصيل الصوتية المح…
