مراجعة VALL-E 2 من Microsoft (تحقيق التكافؤ البشري في TTS بدون تدريب)
TTS بدون تدريب عبر للتو خطاً يعتقد الكثيرون أنه لا يزال سنوات بعيداً: VALL-E 2 من Microsoft هو أول نموذج لغة ترميز عصبي يحقق التكافؤ البشري على كل من LibriSpeech…
فهم VALL-E 2 من Microsoft في 3 دقائق (تحقيق التكافؤ البشري في TTS بدون تدريب)
وقت قصير لكن تحتاج إلى معرفة لماذا أصبحت VALL-E 2 فجأة نقطة المرجع لـ TTS بدون تدريب؟
من Whisper OpenAI إلى خدمة ASR الخاصة بك: التعرف على الكيانات الاسمية والمصطلحات الخاصة بالمجال
Whisper خارج الصندوق مثير للإعجاب، لكن أي شخص قام فعلاً بنشره في الإنتاج يعرف الألم: فهو يخطئ في الأسماء الصحيحة، وأسماء المنتجات، والمصطلحات الطبية، والمصطلحات…
تحليل الباحث من Google المتعمق حول الكلام من طرف إلى طرف، الجزء 1: النظرة العامة والنمذجة
قلل عقد من التعلم العميق معدلات أخطاء كلمات ASR بأكثر من 50 في المئة نسبة، وفي هذه العملية، جعل خطوط أنابيب HMM الكلاسيكية تبدو مثل التراث.
استنتاج معمارية الشبكة العصبية لـ OpenAI GPT-4o
لم تنشر OpenAI ورقة عن GPT-4o، لذا يفعل هذا الفيديو الشيء التالي الأفضل: فهو يقوم بهندسة عكسية لمعمارية الشبكة العصبية التي تبدو أنها بالتأكيد ستكون بناءً على ا…
نموذج Google للكلام العام لـ 100+ لغة يتفوق على نموذج OpenAI Whisper
أنجزت نموذج Google للكلام العام بهدوء شيئاً رائعاً: طابقت أو تفوقت على Whisper من OpenAI في ASR عبر أكثر من 100 لغة مع استخدام ما يقرب من سُبع البيانات المسمى الم…
مراجعة طويلة: MM1 من Apple: الطرق والتحليل والرؤى من التدريب المسبق للنموذج اللغوي متعدد الأنماط
Apple لا تنشر الكثير، لذا عندما ظهرت ورقة MM1 مع دراسة استئصالية كاملة عن التدريب المسبق للنموذج اللغوي متعدد الأنماط، كانت من أكثر إصدارات البيانات المفيدة في…
مراجعة سريعة لـ MM1: نموذج Apple اللغوي متعدد الأنماط SOTA
إذا لم يكن لديك وقت للتفصيل الكامل لـ MM1، فإن هذه المراجعة السريعة تعطيك الأساسيات في بضع دقائق: ما الذي بنته Apple، وماذا تعلموا من الدراسات الاستئصالية على …
السر الذي جعل Claude 3 يتفوق على GPT-4
عندما تفوق Claude 3 Opus على GPT-4 في MMLU و GPQA و GSM8K ومعظم مقاييس التقييم الحدودية، لم يكن السؤال المثير للاهتمام هو ما إذا كانت Anthropic قد قامت ببساطة …
مراجعة نماذج الكلام الكبيرة مفتوحة المصدر من Microsoft+OpenAI و Google و Meta و Nvidia لـ ASR
لقد قامت كل مختبر ذكاء اصطناعي رئيسي الآن بشحن نموذج كلام كبير مفتوح المصدر لـ ASR، وأصبح اختيار النموذج الصحيح للإنتاج قراراً حقيقياً.
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: المعالجة اللاحقة والنمذجة اللغوية
مخرجات Whisper الخام مثيرة للإعجاب خارج الصندوق، لكن أي شخص قام بنشرها لدى مستخدمين حقيقيين يعرف الفجوة بين نسخة توضيحية وشيء يمكن لنظام المعالجة اللاحقة أن يس…
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: الصوت الطويل والبث المباشر (الجزء 3)
تم تدريب Whisper على أجزاء مدتها 30 ثانية، وهذا يظهر عندما تطعمه بودكاست لمدة ساعتين أو تحاول ربطه بخط أنابيب الترجمة المباشرة.
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: العائد على الاستثمار (الجزء 2)
عادة ما يتم طرح سؤال البناء مقابل الشراء بخصوص ASR كمسألة دقة مقابل الراحة، لكن العامل الحقيقي المحدد هو العائد على الاستثمار على مدى عمر المنتج.
من نموذج OpenAI Whisper إلى خدمة ASR الخاصة بك: نظرة عامة (الجزء 1)
عندما فتحت OpenAI مصدر Whisper، أعادت بهدوء تعيين خط الأساس لما تبدو عليه خدمة ASR الخاصة.
لماذا الطوابع الزمنية للكلمات التي ينتجها OpenAI Whisper غير دقيقة؟ كيف تجعلها دقيقة مرة أخرى؟
اطلب من Whisper طوابع زمنية للكلمات وستحصل على أرقام — لكن إذا حاولت يومًا ما محاذاتها مع الصوت الفعلي للكاريوكي أو الترجمة أو المزامنة، ستعرف أنها تنجرف وتنجذب…
الذكاء الاصطناعي التوليدي للكلام: VoiceBox من Meta AI (أيضًا Flow Matching و Neural ODE)
لسنوات عديدة، تخلف توليد الكلام عن توليد النص والصور من حيث النطاق والعمومية — حصلت كل مهمة على نموذج مخصص بها.
مراجعة SpeechT5: إدخال T5 من Google إلى مهام الكلام (ASR, TTS, SID, ...)
وحّد T5 مهام النص إلى النص تحت وصفة تدريب مسبق واحدة للمشفر-فك الشفرة وأصبح حصان العمل في NLP.
[مراجعة Olewave] AudioLM: نهج لنمذجة اللغة لتوليد الصوت
AudioLM هي الورقة البحثية التي أقنعت الكثيرين بأن توليد الصوت يجب أن يبدو أكثر مثل نمذجة اللغة من معالجة الإشارات.
[10 mins] اشرح لماذا Whisper API من OpenAI ليس جيدًا مثل ChatGPT
حقق Whisper نجاحًا كبيرًا، لكنه لم يعيد تشكيل ASR بالطريقة التي أعادت بها GPT-3 تشكيل NLP، وتجادل هذه المراجعة لمدة عشر دقائق بأن الأسباب مدمجة في الورقة البحثية…
مراجعة متعمقة في GPT-3 من OpenAI: نماذج اللغة تتعلم من عينات قليلة (الجزء 1/3: المقدمة والنهج)
يعرض الجزء الأول من هذه المراجعة الثلاثية الأجزاء لـ GPT-3 الورقة التي حولت التوسع من رهان بحثي إلى حقيقة مسلمة في الصناعة.
مراجعة متعمقة لـ VALL-E: نماذج ترميز اللغة العصبية هي مركبات نص إلى كلام بدون عينة
بدت فكرة نقل TTS بدون عينة من مقطع مرجعي مدته ثلاث ثواني بعيدة المنال حتى وصلت VALL-E، وتفكك هذه المراجعة المتعمقة بالضبط كيفية تحقيق Microsoft لذلك.
فهم VALL-E من Microsoft في 3 دقائق (SOTA Zero-shot TTS)
VALL-E هي اللحظة التي توقف فيها TTS عن الظهور مثل انحدار الإشارة وبدأ يبدو مثل نمذجة اللغة، وهذا الشارح السريع يسرع لك الوصول بسرعة.
[مراجعة Olewave] Whisper ASR من OpenAI: التعرف المتين على الكلام من خلال الإشراف الضعيف على نطاق واسع
عندما أطلقت OpenAI Whisper، اضطر مجتمع ASR للتعامل مع نظام تم تدريبه على 680,000 ساعة من الصوت متعدد اللغات ومتعدد المهام ومجمع من الويب، وقد عمل بشكل جيد مباش…
أكثر توضيح تفصيلي من Olewave لـ RNN-T: Sequence Transduction with Recurrent Neural Networks
ورقة RNN-T الخاصة بـ Alex Graves هي السلف الهادئ لكل نظام ASR للبث يتم شحنه اليوم، من معرف Google على الجهاز إلى عدد لا يحصى من مكدسات transducer مفتوحة المصدر…
[مراجعة Olewave الطويلة] التدريب الفعّال لـ Neural Transducer للتعرف على الكلام
محولات Neural هي حصان العمل في ASR للبث، لكن تدريبها بكفاءة مشهور بأنه مؤلم: خسارة RNN-T لديها ذاكرة مكعبة في طول التسلسل، وشبكة المحاذاة تنفجر على الكلام الطو…
[مراجعة طويلة] Conformer: Transformer معزز بالالتفاف للتعرف على الكلام
Conformer هو النموذج الذي استحوذ بهدوء على ASR من النهاية إلى النهاية، وصيغته، وضع وحدة التفاف على كل كتلة Transformer، تبين أنها واحدة من تلك الأفكار البسيطة …
[Long Review] Fully Sharded Data Parallel: تدريب ذكاء اصطناعي أسرع مع معالجات رسوميات أقل
كان تدريب نموذج كلام أو لغة ذو مليار معامل على ميزانية GPU متواضعة يعني الاختيار بين التوازي في خط الأنابيب أو التوازي الموتري أو تجزئة المحسن من نمط ZeRO.
[Short Review] Fully Sharded Data Parallel: تدريب ذكاء اصطناعي أسرع مع معالجات رسوميات أقل
Fully Sharded Data Parallel هي إجابة Meta على سؤال تسأله كل فريق كلام ولغة في النهاية: كيف نقوم بتدريب نماذج أكبر بكثير دون الحاجة إلى معالجات رسوميات أكثر بكث…
من Breaking Bad إلى Wav2vec 2.0: إطار عمل للتعلم ذاتي الإشراف لتمثيلات الكلام
ما الذي يجمع بين Walter White و Jesse Pinkman ودفعة من الصوت غير المسمى؟
استكشاف ضبط Wav2vec 2.0 الدقيق لتحسين التعرف على المشاعر الكلامية
لطالما كان التعرف على المشاعر الكلامية عالقاً مع مجموعات بيانات صغيرة مُحددة والميزات الصوتية المصنوعة يدويّاً.
