Harnessing Wild Data for High-ROI Speech R&D — Our ICASSP 2024 Spotlight

Events

الاستفادة من البيانات البرية لـ Speech R&D عالي العائد — حديثنا البارز في ICASSP 2024

محادثة مؤسسنا والمدير التنفيذي Wei Chu البارزة في ICASSP 2024 حول سبب أن بناء خدمات الكلام التقليدية منخفضة العائد — وكيفية تصفية البيانات البرية + وسم تلقائي للبيانات الخاصة مع نماذج الكلام الأساسية مفتوحة المصدر الكبيرة يقلب المعادلة.

Harnessing Wild Data for High-ROI Speech R&D — Our ICASSP 2024 Spotlight

في IEEE ICASSP 2024 في سيول، ألقى مؤسسنا والمدير التنفيذي Wei Chu محادثة بارزة عن التحول الذي يجعل speech R&D في المؤسسات أرخص بكثير: توقف عن دفع رسوم لموظفي الوسم البشريين والمجموعات المسلمة الجاهزة، ابدأ في الاستفادة من البيانات البرية ونماذج الأساس مفتوحة المصدر الكبيرة.

اعرض المحادثة على برنامج ICASSP 2024 →

لماذا بناء خدمات الكلام التقليدية منخفضة العائد

كل مؤسسة تبني voice AI تواجه نفس الثلاث اختصارات الغريبة. لكل واحدة سقف ROI مخفي:

اتصل بـ APIs السحابة سريع للنماذج الأولية، تكلفة R&D صغيرة. لكن ليس قابل للتخصيص لمنتجك، أداء غير مرضٍ على بيانتك المحددة، مكلف في الحجم، وكل طلب هو ناقل محتمل لخرق البيانات.

الشراء من البائعين أرخص من DIY على الورق. في الممارسة: فواتير كبيرة من البائعين من البيانات والنظام، أداء أقل من المثالي بسبب الفوضى الكاملة للتواصل بين الشركات، وما زال مخاطر خرق البيانات.

DIY مثل عملاق التكنولوجيا (Alexa و Siri و Google Voice Search) مكدس الخاص، أمان البيانات الكاملة — و استثمار بخمس سنوات وعشرات الملايين في فريق R&D والتنسيق البيانات والبنية التحتية قبل أن تشحن.

لا تأتي البدائل "الرخيصة" الأخرى بحالة أفضل. فريق العقود في الخارج أو مجموعات البيانات المحاكاة أو الحصول على شركة ناشئة سوية كلها تضحي بـ ROI لتوفير المال.

البديل عالي العائد — الوقوف على أكتاف نماذج كلام كبيرة

يدعم نهج Olewave نوبتان:

ركب قانون التحجيم. منذ 2022، عملاقات التكنولوجيا يفتحون CC-BY نماذج كلام كبيرة — Whisper و SeamlessM4T والمزيد. لم تعد تحتاج إلى إعادة اختراع العجلة. ضبط دقيق لنموذج أساس على تخصصك بدلاً من التدريب من الصفر. هذا يلغي معظم فريق R&D والبيانات والتدريب والبنية التحتية المتعلقة بالإنفاق.

صفي البيانات البرية والبيانات الخاصة وسم تلقائي. البيانات البرية المصفاة — النسخ المتحققة والطوابع الزمنية وعلامات الموضوع التي ينتجها نظام وسم مدفوع بالذكاء الاصطناعي — تُستخدم لضبط دقيق نموذج مجال. يقوم نموذج المجال بعد ذلك بوسم بيانتك الخاصة بدرجات ثقة. لا موظفي الوسم البشريين. لا تترك البيانات البنية التحتية الخاصة بك. لا توجد مخاطر خرق. وبدون فواتير لمجموعات البيانات المحاكاة المسلمة.

خط الأنابيب بوسم مخصص من أربع خطوات

  1. Jump Start — اختر البيانات البرية من نفس مجال العميل، وضبط دقيق لنموذج مجال من نموذج أساس كلام/لغة كبير.
  2. Auto Label — يقوم نموذج المجال بوسم بيانات العميل الخاصة بدرجات ثقة لكل كلمة وكل مذكرة. لا يحتاج موظفو الوسم البشريين — لذا لا توجد أيضاً مخاطر خرق بيانات.
  3. Iteratively Learn — ادمج مجموعة من البيانات الخاصة والعامة المسومة، ضبط دقيق لنموذج المجال مرة أخرى، ثم أعد وسم بيانتك الخاصة باستخدام نسخة محسنة. كرر حتى تصل الجودة إلى مستوى ثابت.
  4. Good to Go — توقف عن التكرار عندما تكون الجودة كافية. نرخص SDK Tycho الخاص بنا حتى تتمكن من الاستمرار في الوسم والبناء على البنية التحتية الخاصة بك.

لماذا هذا مهم

  • التدريب الخاضع للإشراف لنماذج خاصة بالمجال دون موظفي وسم البيانات البشريين — أكبر تكلفة متكررة في مشاريع الكلام في المؤسسات.
  • لا توجد مخاطر خرق البيانات — البيانات الخاصة لا تترك بيئتك.
  • تكلفة وسم منخفضة بشكل كبير — النماذج تقوم بالعمل؛ البشر يراجعون الحالات الحدية.
  • نفس مسار الضبط الدقيق يقياس إلى مجالات ولغات وحالات استخدام جديدة مع نضوج منتجك.

تحدث معنا

إذا كنت تقيّم البناء مقابل الشراء لمنتج voice AI، أو محاولة تقليل نفقات الوسم بيانات على منتج موجود، فنود أن نقارن الملاحظات.

أرسل بريداً إلكترونياً إلى [email protected] أو تواصل عبر الموقع — سنرد خلال يوم عمل واحد.