BigSSL:探索自动语音识别大规模半监督学习的前沿
当您采用半监督 ASR 配方(在 100M 参数上击败了最先进的技术)并且只是……继续扩展时,会发生什么?
当您采用半监督 ASR 配方(在 100M 参数上击败了最先进的技术)并且只是……继续扩展时,会发生什么? Google 的 BigSSL 使用 80 亿参数的 Conformer 进行了回答,该 Conformer 经过一百万小时未标记的 YouTube 音频以及数万小时的监督数据的训练,并表明收益不断增加,尤其是在尾部:低资源域、口音语音和长格式识别。
这篇论文实际上是两个贡献合二为一。这是一项实证研究,研究了当 SSL 超过 10 亿个参数时会发生什么问题以及会发生什么问题,它证明了单个预训练编码器可以充当十几个下游 ASR 任务的通用起点,从而降低 YouTube、电话和语音搜索基准测试上的 WER 下限。演讲涵盖了预训练管道、跨领域的传输结果,以及对任何权衡基础模型方法对其语音堆栈是否有意义的人的实际影响。如果您正在计划下一次大规模训练,那么值得排队。
