Google's Universal Speech Model for 100+ languages beats OpenAI's Whisper Model

Tutorials

نموذج Google للكلام العام لـ 100+ لغة يتفوق على نموذج OpenAI Whisper

أنجزت نموذج Google للكلام العام بهدوء شيئاً رائعاً: طابقت أو تفوقت على Whisper من OpenAI في ASR عبر أكثر من 100 لغة مع استخدام ما يقرب من سُبع البيانات المسمى المستخدمة في التدريب.

أنجزت نموذج Google للكلام العام بهدوء شيئاً رائعاً: طابقت أو تفوقت على Whisper من OpenAI في ASR عبر أكثر من 100 لغة مع استخدام ما يقرب من سُبع البيانات المسمى المستخدمة في التدريب. تغوص هذه المراجعة في كيفية تحقيقهم لذلك — والإجابة ليست مجرد حساب أكثر. يعتمد USM على مجموعة بيانات ضخمة غير مسمى بـ 12 مليون ساعة تغطي أكثر من 300 لغة، ثم يستخدم تحديد الإسقاط العشوائي لتدريب الترميز قبل السيترفيسي بإشراف ذاتي بالإضافة إلى مطابقة حالة الكلام والنص لربط الانتقال النظيف في الضبط الدقيق الخاضع للإشراف على مجموعات مسمى أصغر بكثير.

تغطي الجولة وصفة التدريب الكامل قبل السيترفيسي، لماذا يعمل RPQ كمحدد وزن خفيف للهدف SSL دون الحاجة إلى دفتر رموز مكتسب، وكيف تحاذي مطابقة حالة تمثيلات الكلام والنص دون طلب بيانات مقترنة على نطاق الويب. النتيجة هي ترميز واحد يعمم على مهام النزول متعددة اللغات ASR وترجمة الكلام إلى النص عبر ذيل طويل من اللغات منخفضة الموارد داخل المجال وخارجه، وهو بالضبط حيث يبدأ نهج Whisper الخاضع للإشراف بالكامل في الضغط. إذا كان منتجك بحاجة إلى خدمة المستخدمين بعيداً عن أفضل 20 لغة، فهذا هو معمارية النموذج التي تستحق الفهم قبل الالتزام بمكدس كلام متعدد اللغات.