What Makes Olewave's Speech Data Cleaning Pipeline Effective and Unique

Research

ما الذي يجعل خط أنابيب تنظيف بيانات الكلام من Olewave فعالاً وفريداً من نوعه

كيف يحول خط أنابيب Olign من Olewave الصوت الخام إلى بيانات تدريب ASR/TTS جاهزة للإنتاج — نصوص محققة، طوابع زمنية على مستوى الكلمة، ودرجات ثقة، بدون مصنفين بشريين.

What Makes Olewave's Speech Data Cleaning Pipeline Effective and Unique

خط أنابيب تنظيف بيانات الكلام المتقدمة والقابلة للتخصيص بدرجة عالية من Olewave يتكامل بسلاسة مع خط أنابيب جمع بيانات الكلام الخاص به، ليشكل معاً خط أنابيب تجميع بيانات الكلام من Olewave. يتم تصميم هذا النظام الشامل بعناية فائقة لتقديم مجموعات بيانات كلام عالية الجودة ومتسقة وفعالة من حيث التكلفة على نطاق واسع، مصممة خصيصاً لمجموعة واسعة من التطبيقات اللاحقة. بالإضافة إلى ذلك، نقدم مجموعات بيانات كلام واسعة النطاق وفعالة من حيث التكلفة تم تجميعها من خلال خط أنابيبنا، متوفرة بلغات متعددة وتغطي موضوعات متنوعة.

خط أنابيب تنظيف بيانات الكلام المتقدمة والقابلة للتخصيص بدرجة عالية من Olewave يتكامل بسلاسة مع خط أنابيب جمع بيانات الكلام الخاص به، ليشكل معاً خط أنابيب تجميع بيانات الكلام من Olewave.

يوضح الشكل أدناه سير العمل المبسط لخط أنابيب تنظيف بيانات الكلام لدينا، مما يعرض قدرته على تحويل بيانات الكلام الخام وغير المنظمة إلى مجموعات بيانات مصقولة وقابلة للتطبيق.

يوفر خط أنابيبنا عدة مزايا:

  • فعال: ينتج تسميات وتنسيقات متحدثين محققة، طوابع زمنية دقيقة للكلمات ودرجات ثقة غير مفرطة مقارنة بأدوات مثل Whisper والحلول مفتوحة المصدر الأخرى.
  • قوة: يتعامل مع الكلام الحواري الحر والمرتجل، بما في ذلك السيناريوهات التي يحدث فيها تداخل المتحدثين والنصوص التي تحتوي على أخطاء ASR.
  • قابل للتوسع: يستفيد من البيانات الوصفية الاختيارية ويمكن ترقيته لدمج طرائق إضافية لزيادة موثوقية التصنيف. يدعم خط الأنابيب أيضاً التكامل السلس للعديد من نماذج وضع التسميات الخاصة بـ Olewave أو العميل الخاصة (على سبيل المثال، العاطفة، الدلالات، ...).
  • كفاءة: يعمل بسرعة وفعال من حيث التكلفة، لأنه يتطلب موارد GPU قليلة أو معدومة.
بالإضافة إلى ذلك، إذا كان هدفك هو الحصول على معلقين بشريين لتحسين نتائج الكلام المسموع التلقائي (ASR)، فيمكن لمخرجات خط أنابيبنا أن تقلل بشكل كبير من تكاليف التصنيف من خلال:
  • تسليط الضوء بدقة على الكلمات التي تحتوي على معلومات توقيت دقيقة، مما يسمح للمعلقين بتحديد وقراجعة المقاطع الغير واضحة أو المبهمة بسرعة دون الاستماع إلى الملف الصوتي بالكامل بشكل متكرر.
  • توجيه المعلقين للتركيز على الكلمات التي لها درجات ثقة متوسطة، مما يقلل الحاجة لمراجعة كل كلمة ويبسط عملية التصحيح.

من خلال توفير هذه الرؤى المستهدفة، يعزز خط أنابيبنا الكفاءة، ويقلل الجهد اليدوي، ويضمن سير عمل تصنيف أكثر فعالية من حيث التكلفة.

فيما يلي أمثلة مرئية على مخرجات خط الأنابيب، تعرض تسميات المتحدث والطوابع الزمنية على مستوى الكلمة ودرجات الثقة:

الشكل 1. المحادثة من تفاعلات العالم الحقيقي، وليست من الكلام الاصطناعي أو المطالبات. تم تحميل النصوص يدوياً بواسطة البشر، وليس توليدها بواسطة ASR. تم إضافة تسميات المتحدث يدوياً بواسطة البشر أيضاً، وليس استخراجها من خوارزميات تقسيم المتحدث. يتضمن ملف JSON المرفق نصوصاً تفصيلية، مع فترات زمنية للمتحدث وتنسيقات المحادثة والطوابع الزمنية على مستوى الكلمة ودرجات الثقة. الطوابع الزمنية على مستوى الهاتف ودرجات الثقة متاحة عند الطلب أيضاً.

الشكل 2. مثال على معالجة الكلام العفوي الضوضائي، حيث تمثل القيمة تحت كل كلمة درجة النطق الخاصة بها، والتي ترتبط ارتباطاً وثيقاً بتقييم الكلام. فيما يلي شرح درجات بعض الكلمات: أ) كلمة "معاً": تم نطقها مثل "معا-"، النهاية "-ر" غير موجودة، وحرف العلة "-ا-" قصير جداً في المدة، تقريباً مفقود. ب) كلمة البداية "هو": بالكاد يمكنني سماعها على الرغم من وجود هاتف احتكاكي على مخطط الطيف. لديها درجة منخفضة 0.47 مما يعني أن الكلمة من المحتمل أن تكون مفقودة. ج) الكلمة المدرجة "lt" في النهاية: الشخص لم ينطقها. السبب هو أن النص يتضمن بشكل خاطئ "&lt" (رمز "<" المستخدم في HTML). الدرجة المنخفضة جداً 0.13 تشير إلى أنها كلمة مدرجة يمكن إزالتها بواسطة خط أنابيب تنظيف البيانات الخاص بنا.

من المعترف به على نطاق واسع في الوسط الأكاديمي والصناعي أن أطر E2E (من طرف إلى طرف) الكبيرة ونماذج ASR الكبيرة من طرف إلى طرف لها قيود متأصلة عندما يتعلق الأمر بإنتاج طوابع زمنية دقيقة على مستوى الكلمة ودرجات ثقة موثوقة على مستوى الكلمة، على التوالي.

لمعالجة هذه القيود، نستفيد من خبرتنا العميقة في تقنيات محاذاة الكلام إلى النص غير E2E وقد طورنا إجراءات متطورة تتضمن معلومات البيانات الوصفية. يسمح لنا هذا النهج بتنظيف المحتوى غير المنطوق بشكل فعال (على سبيل المثال، كلمات الملء، نصوص الضوضاء الخلفية) من النصوص، مما يضمن دقة وموثوقية أعلى في المخرجات النهائية.

إليك مقتطف من مخرجات JSON على مستوى الكلمة لخط أنابيب البيانات. يشير حقل "المتحدث" إلى معرف المتحدث في هذا التسجيل. تشير حقول "start_time" و "end_time" بالثواني إلى الفترة الزمنية للمتحدث الناطق. يحتوي حقل "block" على واحد أو عدة تعبيرات متتالية من نفس المتحدث. كل تعبير له وقت بداية ونهاية خاص به، ونص، ومؤشر تداخل المتحدث، ودرجة ثقة. عندما يكون حقل "overlap" صحيحاً، فهذا يعني أن الجزء الحالي يحتوي على تداخل متحدث مع القطاعات المجاورة. تتراوح درجة الثقة من 0 إلى 1.

{
        "speaker": 0,
        "start_time": "47.18",
        "end_time": "49.83",
        "block": [
            {
                "start_time": "47.18",
                "end_time": "49.83",
                "transcript": "music-related jobs compared to New York and LA.",
                "overlap": false,
                "word_details": [
                    {
                        "start_time": "47.18",
                        "end_time": "47.53",
                        "word": "music",
                        "confidence": "0.97"
                    },
                    {
                        "start_time": "47.53",
                        "end_time": "47.89",
                        "word": "related",
                        "confidence": "0.79"
                    },
                    {
                        "start_time": "47.89",
                        "end_time": "48.44",
                        "word": "jobs",
                        "confidence": "0.98"
                    },
                    {
                        "start_time": "48.44",
                        "end_time": "48.90",
                        "word": "compared",
                        "confidence": "0.96"
                    },
                    {
                        "start_time": "48.90",
                        "end_time": "48.96",
                        "word": "to",
                        "confidence": "0.17"
                    },
                    {
                        "start_time": "48.96",
                        "end_time": "49.08",
                        "word": "new",
                        "confidence": "0.97"
                    },
                    {
                        "start_time": "49.08",
                        "end_time": "49.37",
                        "word": "york",
                        "confidence": "0.98"
                    },
                    {
                        "start_time": "49.37",
                        "end_time": "49.49",
                        "word": "and",
                        "confidence": "0.92"
                    },
                    {
                        "start_time": "49.49",
                        "end_time": "49.83",
                        "word": "la",
                        "confidence": "0.56"
                    }
                ]
            }
        ]
    },

X LinkedIn Facebook Email