Tutorials
ワン編集距離FSA/ネットワークベース(OEDN)による誤発音検出とアクセント付きASR
非ネイティブ音響モデリングはニワトリと卵の問題を持っています:悪い音素アライメントは悪いモデルを生成し、悪いモデルは悪いアライメントを生成します。
Tutorials
Olewaveの最も詳細なRNN-T説明:リカレントニューラルネットワークによるシーケンス変換
Alex Graves'のRNN-Tペーパーは、今日出荷されているほぼすべてのストリーミングASRシステムの静かな祖先です。Googleのオンデバイスレコグナイザーから、NeMo、ESPnet、およびそれ以上の無数のオープンソーストランスデューサースタックまで。
