A Review of Microsoft+OpenAI, Google, Meta, and Nvidia's Open Source Large Speech Models for ASR

Tutorials

مراجعة نماذج الكلام الكبيرة مفتوحة المصدر من Microsoft+OpenAI و Google و Meta و Nvidia لـ ASR

لقد قامت كل مختبر ذكاء اصطناعي رئيسي الآن بشحن نموذج كلام كبير مفتوح المصدر لـ ASR، وأصبح اختيار النموذج الصحيح للإنتاج قراراً حقيقياً.

لقد قامت كل مختبر ذكاء اصطناعي رئيسي الآن بشحن نموذج كلام كبير مفتوح المصدر لـ ASR، وأصبح اختيار النموذج الصحيح للإنتاج قراراً حقيقياً. تضع هذه المراجعة الثقال جنباً إلى جنب: Whisper من OpenAI، وإصدارات Google المجاورة لـ USM، و MMS من Meta ونسب wav2vec 2.0، وعائلة NeMo من Nvidia (Conformer و Parakeet و Canary). الهدف هو إجراء مقارنة صادقة عبر المحاور التي تهم حقاً الفرق التي تشحن منتجات كلام — الدقة على الصوت الواقعي، تغطية اللغة، الكمون، الترخيص، بيئة ضبط دقيق، وحجم المجتمع حول كل مكدس.

بدلاً من تكرار أرقام لوحة المتصدرين، يركز الجزء على المكان الذي يكسب فيه كل نموذج رزقه والمكان الذي ينخفض فيه بهدوء: النسخ طويلة الشكل، تبديل الرموز، التكيف المجالي، البث، والتكلفة العملية لتشغيلها على نطاق واسع. كما أنه يشير إلى المقايضات بين فكاكات Transformer من طرف إلى طرف وبنى على طراز CTC عندما تحتاج إلى الطوابع الزمنية أو انحياز الكلمات الرئيسية. إذا كنت تقيم نموذج أساس ASR مفتوح المصدر لخط الأنابيب الخاص، فإن هذا الملخص هو خريطة بداية صلبة قبل أن تحرق ساعات GPU في معايرتها جميعاً بنفسك.