ワン編集距離FSA/ネットワークベース(OEDN)による誤発音検出とアクセント付きASR
非ネイティブ音響モデリングはニワトリと卵の問題を持っています:悪い音素アライメントは悪いモデルを生成し、悪いモデルは悪いアライメントを生成します。
非ネイティブ音響モデリングはニワトリと卵の問題を持っています:悪い音素アライメントは悪いモデルを生成し、悪いモデルは悪いアライメントを生成します。ワン編集距離FSA/ネットワークベース(OEDN)アプローチに関するこのトークは、制約付き音素デコーダを使用して標準発音の1編集距離内で最も可能性の高い発音シーケンスを認識し、誤発音がなくなるまで検出と認識を反復することで、そのループを破ります。
300時間の非ネイティブ自発的コーパス上で、結果として得られた音響モデルは、マッチングされたニューラルトポロジーを備えた十分に調整されたコンテキスト依存分解TDNN HMMベースラインに対して、WERを6%削減しました。これはその規模では小さなデルタではありません。精度の勝利を超えて、パイプラインは非ネイティブ英語学習者からの共通の誤発音パターンのデータドリブンカタログを生成し、これは音声評価および発音スコアリング製品に直接有用です。このトークは、良好性スコア(goodness-of-pronunciation scores)がどのように初期検出を駆動するか、ワン編集距離制約がどのように検索をトラクタブルに保つか、および繰り返し反復がアライメントを収束するまで改善し続ける方法について説明します。アクセント付きASR、コンピュータ支援発音訓練、またはディクショナリーがあなたに嘘をつく音響モデリングタスクに取り組んでいる場合は、再生して具体的で再現可能なレシピを確認してください。
