用於帶口音ASR的非碰撞誤讀音添加(NCMA)
帶口音和非母語語音會以悄無聲息的方式破壞發音詞典,進而毒害您的聲學模型對齊,而這項Interspeech 2021的工作提出了一個看似簡單的問題:如果我們只是添加了de
帶口音和非母語語音會以悄無聲息的方式破壞發音詞典,進而毒害您的聲學模型對齊,而這項Interspeech 2021的工作提出了一個看似簡單的問題:如果我們只是將檢測到的誤讀音添加到詞典中並重新訓練呢?非碰撞誤讀音添加(NCMA)是PAII提交給Interspeech 2021非母語兒童英語Close Track ASR挑戰賽的技術,它直接針對兒童語音、二語習者和帶口音的成人語音對生產ASR造成的WER痛點。
本演示說明瞭NCMA如何在將新發音注入詞典時避免碰撞,更好的音素對齊如何反饋到更強大的聲學模型中,以及整個檢測-添加-重新對齊循環如何轉化為在真正困難的基準上測量的WER下降。該技術基於W. Chu、P. Chang和J. Xiao在Interspeech 2021發表的論文,演示將算法選擇與激發它們的挑戰提交聯繫起來。如果您正在為教育、兒童產品、計算機輔助語言學習或帶口音說話者等各種場景構建ASR,其中通用詞典會默無聲息地失敗,值得花時間了解有針對性的詞典修復如何優於蠻力數據收集。
