Video
Tutorials
UniSpeech-SAT:通用语音表示学习与说话人感知预训练
自监督语音模型倾向于优先学习语音学内容,而将说话人身份作为附带考虑——这对ASR来说可以接受,但对说话人验证、说话人分段或语音克隆则表现不佳。
Video
Tutorials
SNRi目标训练用于联合语音增强和识别
联合训练语音增强和ASR听起来很明显——只需通过去噪器反向传播识别损失——但实际上很混乱,因为激进的去噪常常扭曲声学模型依赖的特征
