مراجعة VALL-E 2 من Microsoft (تحقيق التكافؤ البشري في تحويل النص إلى كلام بدون إطلاق النار)
تجاوزت اللقطة الصفرية TTS للتو خطًا اعتقد الكثيرون أنه لا يزال على بعد سنوات: VALL-E 2 الخاص بـ Microsoft هو أول نموذج لغة ترميز عصبي يحقق التكافؤ البشري في كل …
فهم Microsoft VALL-E 2 في 3 دقائق (تحقيق التكافؤ البشري في صفر لقطة TTS)
هل ليس لديك وقت كافٍ لكن تريد معرفة لماذا أصبحت VALL-E 2 فجأة النقطة المرجعية لـ zero-shot TTS؟
مراجعة DiTAR: نمذجة الانتشار Transformer نمذجة الانحدار الذاتي لتوليد الكلام ~ Seed-TTS
عاد فريق Seed-TTS بـ DiTAR، وهي إجابة نظيفة على أحد أكثر المقايضات المحرجة في توليد الكلام الحديث: كيف تحافظ على مرونة التمثيلات المستمرة للكلام بدون دفع ثمن ا…
مراجعة ByteDance/Tiktok MusicGen: عائلة من نماذج توليد الكلام متعددة الاستخدامات وعالية الجودة
يعتبر Seed-TTS من ByteDance أحد أقوى الإشارات حتى الآن على أن TTS ينتقل من مكون إلى نموذج أساس حقيقي.
من OpenAI Whisper إلى خدمة ASR الداخلية: التعرف على كيانات الأسماء والشروط الخاصة بالنطاق
Whisper خارج الصندوق مثير للإعجاب، لكن أي شخص قام بنشره فعلاً في الإنتاج يعرف الألم: فهو يتعثر في الأسماء الصحيحة وأسماء المنتجات والمصطلحات الطبية والمصطلحات ا…
Meta فيلم Gen مقابل OpenAI Sora: مراجعة تفصيلية
أخيراً أظهرت Meta يدها ضد Sora، و Movie Gen هو أكثر من مجرد مولد فيديو — إنه مجموعة من نماذج الأساس التي تنتج فيديو HD بدقة 1080p عبر نسب عرض متعددة مع صوت متزا…
التحليل المتعمق الذي أجراه باحث Google حول التعرف الشامل على الكلام، الجزء الأول: نظرة عامة والنمذجة
عقد من التعلم العميق قلل معدلات خطأ الكلمات ASR بأكثر من 50% نسبياً وفي نفس الوقت جعل خطوط أنابيب HMM الكلاسيكية تبدو بمثابة بقايا.
استبعد بنية الشبكة العصبية OpenAI GPT-4o
لم تنشر OpenAI ورقة بحثية عن GPT-4o، لذا يفعل هذا الفيديو الشيء التالي الأفضل: إنه يعكس هندسة الشبكة العصبية التي تبدو بكل تأكيد تقريباً بناءً على القدرات التي أ…
نموذج الكلام العالمي من Google لأكثر من 100 لغة يتفوق على نموذج OpenAI الخاص بـ Whisper
قام نموذج Google للكلام العالمي بشيء ملحوظ بهدوء: مطابقة أو تفوق على OpenAI's Whisper في ASR عبر 100+ لغة مع استخدام تقريباً سُبع بيانات التدريب الموسومة.
مراجعة طويلة: MM1 من Apple: الأساليب والتحليلات والرؤى من التدريب المسبق للوسائط المتعددة LLM
لا تنشر Apple الكثير، لذا عندما وصلت ورقة MM1 مع دراسة استقصائية كاملة لما قبل تدريب MLLM متعدد الطرائق، كانت واحدة من إصدارات البيانات الأكثر فائدة للسنة لأي …
مراجعة سريعة لجهاز SOTA Multimodal من Apple LLM: MM1
إذا لم يكن لديك الوقت لقراءة تحليل MM1 الكامل، فهذا الاستعراض السريع يقدم لك الأساسيات في بضع دقائق: ما الذي بنته Apple، وما الذي تعلموه من الدراسات الاستئصالي…
السر الذي صنع Claude 3 ترامب GPT-4
عندما تفوق Claude 3 Opus على GPT-4 في MMLU و GPQA و GSM8K وغالبية معايير التقييم الحدية، لم يكن السؤال المثير للاهتمام ما إذا كانت Anthropic قد قامت بالتوسع بش…
نماذج الذكاء الاصطناعي التوليدية المتعلقة بسورا: تطبيع التدفقات
الجميع يتحدثون عن الانتشار، لكن إذا كنت تريد فعلاً أن تفهم شجرة العائلة التي أنتجت Sora والفيديو التوليدي الحديث، فأنت بحاجة إلى قضاء بعض الوقت مع التدفقات المع…
التشفير التلقائي المتغير (VAE) وخدعة إعادة المعلمة - إعادة النظر في النموذج التوليدي الكلاسيكي
قبل الانتشار، قبل تدفقات التطبيع، قبل أن تبني نماذج الانتشار الكامنة بهدوء مشفرات VAE في كل مكدس توليدي جاد — كانت هناك ورقة Kingma و Welling لعام 2013 تقدم Va…
مراجعة لـ Microsoft+OpenAI، Google، Meta، ونماذج الكلام الكبيرة مفتوحة المصدر Nvidia لـ SDK
أطلقت كل مختبر ذكاء اصطناعي رئيسي الآن نموذج كلام كبير مفتوح المصدر لـ ASR، واختيار النموذج المناسب للإنتاج أصبح قرارًا حقيقيًا.
[قراءة تفصيلية للورقة] Zipformer: برنامج تشفير أسرع وأفضل للتعرف التلقائي على الكلام
كان Conformer هو مشفر ASR الافتراضي لسنوات، لكن Zipformer من فريق k2/icefall استحوذت بهدوء على تاج WER على LibriSpeech و Aishell-1 و WenetSpeech بينما كانت أسر…
Tycho: تم استخدامه لبناء خدمات داخلية ذات عائد استثمار مرتفع (ASR/TTS/ترجمة):نظرة عامة
معظم الفرق التي تريد خدمة ASR أو TTS أو ترجمة الكلام في المنزل تواجه نفس الخيار الفوضوي: لصق أجزاء من ESPnet و NeMo و k2 و HuggingFace معاً، أو تسليم كل شيء إلى…
من نموذج OpenAI الخاص بـ Whisper إلى الخدمة الداخلية الخاصة بك ASR: المعالجة اللاحقة ونمذجة اللغة
مخرجات Whisper الخام مثيرة للإعجاب من البداية، لكن أي شخص نشرها لمستخدمين حقيقيين يعرف الفجوة بين نص نسخ عرضي وشيء يمكن لنظام أسفل الاتجاه استهلاكه فعلاً.
من نموذج OpenAI Whisper إلى خدمة ASR الداخلية: الصوت الطويل والبث المباشر (الجزء 3)
تم تدريب Whisper على أجزاء مدتها 30 ثانية، وهذا واضح في اللحظة التي تغذيها فيها بملف بودكاست مدته ساعتان أو تحاول وصله بخط ترجمة مباشر.
من نموذج OpenAI Whisper إلى خدمة ASR الداخلية: ROI (العائد على الاستثمار) (الجزء الثاني)
عادة ما يتم صياغة سؤال البناء مقابل الشراء لـ ASR كمسألة دقة مقابل الراحة، لكن العامل الحاسم الفعلي هو ROI على مدار عمر المنتج.
من نموذج OpenAI Whisper إلى الخدمة الداخلية الخاصة بك ASR: نظرة عامة (الجزء الأول)
عندما يكون OpenAI مفتوح المصدر Whisper، فإنه يعيد ضبط الأساس بهدوء لما تبدو عليه خدمة ASR الداخلية.
لماذا الطوابع الزمنية للكلمات التي تم إنشاؤها بواسطة OpenAI Whisper ليست دقيقة؟ كيفية جعلها دقيقة مرة أخرى؟
اطلب من Whisper الطوابع الزمنية للكلمات وستحصل على الأرقام مرة أخرى - ولكن إذا حاولت مواءمتها مع الصوت الفعلي للكاريوكي، أو التعليق التوضيحي، أو الدبلجة، فأنت …
الذكاء الاصطناعي المولد للكلام: VoiceBox بواسطة Meta AI (أيضًا مطابقة التدفق و ODE العصبي)
لسنوات، تأخر إنتاج الكلام عن إنشاء النصوص والصور من حيث الحجم والعمومية، حيث كان لكل مهمة نموذجها المخصص الخاص بها.
I-JEPA: النموذج العالمي الأول للرؤية الحاسوبية ليان ليكون
ظل يان ليكون يجادل منذ سنوات بأن التدريب المسبق التوليدي هو الرهان الخاطئ لبناء آلات تفهم العالم.
LoRA: السماح لطالب المدرسة الثانوية بتدريب نموذج اللغة الكبير (GPT-3) باستخدام بطاقة رسومات الألعاب
لا يعد الضبط الدقيق الكامل لمعلمة GPT-3 ذات 175 بايت أمرًا غير مناسب للجميع تقريبًا - فوحدة التخزين وحدها تستبعد ذلك، ناهيك عن وحدات معالجة الرسومات.
مراجعة SpeechT5: تقديم مهام Google T5 في الكلام (ASR، TTS، SID، ...)
قام T5 بتوحيد مهام تحويل النص إلى نص بموجب وصفة تدريب مسبق واحدة لجهاز التشفير وفك التشفير وأصبح بمثابة العمود الفقري لـ NLP.
مراجعة Deepmind's WaveNet لـ TTS/تركيب الصوت (هل يبدو مثل GPT بالنسبة لك؟)
قبل Tacotron، قبل VALL-E، قبل أن تقوم برامج الترميز العصبية بتحويل الصوت إلى رموز مميزة، كانت WaveNet الخاصة بـ DeepMind هي الورقة التي أظهرت أن الشبكات العصبي…
مراجعة HiFi-GAN: شبكات الخصومة التوليدية لتوليف الكلام بكفاءة ودقة عالية
لفترة طويلة، أجبرتك المشفرات الصوتية العصبية على اختيار جانب: نماذج الانحدار التلقائي مثل WaveNet أعطتك صوتًا رائعًا ولكنها كانت بطيئة بشكل مؤلم، في حين أن مولدا…
مراجعة متعمقة لبرنامج SoundStream من Google: برنامج ترميز الصوت العصبي الشامل
أصبحت برامج الترميز العصبية بهدوء هي الطبقة الأساسية للصوت التوليدي الحديث، ويعد SoundStream أحد الأوراق البحثية التي بدأت العمل.
الكشف عن رؤية OpenAI GPT-4 + نموذج النص والبيانات وتكلفة التدريب (تكهنات)
من المعروف أن OpenAI رفض الكشف عن بنية GPT-4، أو عدد المعلمات، أو بيانات التدريب، أو ميزانية الحوسبة، مما أدى إلى تحويل التقرير الفني إلى اختبار Rorschach لمجت…
