Tutorials
地理的モデルを使用したローカルPOI音声認識精度の向上
ボイスアシスタントに小さなローカルレストランへのナビゲーションを依頼すると、ASRが失敗する場所がすぐにわかります—LMトレーニングコーパスに登場しなかったロングテールPOI名。
Tutorials
UniSpeech-SAT: スピーカー認識事前学習による汎用音声表現学習
自己教師あり音声モデルは音韻内容を見事に学習する傾向があるが、スピーカーアイデンティティは後付けになる傾向がある。これはASRには問題ないが、スピーカー検証、ダイアリゼーション、音声クローニングには最悪である。
Tutorials
SNRi ターゲット学習による音声強調と認識の結合学習
音声強調とASRの結合学習は明らかに見える。デノイザーを通じて認識損失をバックプロップするだけだ。しかし実際には、積極的なノイズ除去が音響モデルが依存する機能をしばしば歪めるので、複雑である。
