三胞胎般的俄罗斯花样滑冰运动员:Kullback-Leibler 散度能用来区分他们吗?
说话人自适应是那些 ASR 问题之一,听起来似乎已经解决,直到你实际尝试自适应一个序列到序列模型而不破坏编码器来之不易的声学表示。
说话人自适应是那些 ASR 问题之一,听起来似乎已经解决,直到你实际尝试自适应一个序列到序列模型而不破坏编码器来之不易的声学表示。这次演讲使用了近乎相同的俄罗斯花样滑冰运动员的记忆框架来询问 KL 散度是否能够区分非常相似的说话人分布,并详细讲述了"Listen, Attend, Spell and Adapt":一个说话人自适应的 seq2seq ASR 架构,它保持基础模型完整,同时学习一个轻量级的每说话人组件。
期望一个仔细的观察,说明 KL 正则化如何防止自适应过程中的灾难性漂移,自适应数据预算如何与 WER 收益进行权衡,以及为什么 LAS 式注意力编码器在自适应下的行为与混合 HMM 系统不同。对于任何构建个性化语音界面、语音克隆堆栈或具有每用户声学配置文件的听写产品的人来说,这里的想法仍然可以直接转化为 Conformer 和基于转导器的系统。如果说话人自适应对您的 ASR 栈很重要,就观看此视频吧。
