Tutorials
[长评] 多维Transformer中的Axial Attention
对图像或视频进行完整自注意力的计算成本太高,那么你如何在不产生二次计算爆炸的情况下保持Transformer的表达能力呢?
Tutorials
[短评] 多维Transformer中的Axial Attention
Axial Attention是使Transformer在高维数据上保持可处理性的优雅想法之一:你不是一次对所有像素或所有时间-频率箱进行注意力计算,而是一次沿一个轴进行。
Tutorials
[长评] 从说话人验证迁移学习到多说话人Text-To-Speech合成
这是使零样本声音克隆实用化的论文:在具有数千个嘈杂、无转录的声音上训练说话人编码器以进行判别验证任务,然后将这些嵌入馈送到Tacotron 2 s
Tutorials
[短评] 从说话人验证迁移学习到多说话人Text-To-Speech合成
启动现代零样本声音克隆浪潮的Google论文具有美观简洁的架构:基于验证训练的说话人编码器、将文本加说话人嵌入转化的Tacotron 2合成器
Tutorials
[长评] Wav2Seq:使用伪语言预训练语音到文本编码器-解码器模型
大多数语音预训练集中在编码器侧,wav2vec、HuBERT、WavLM,但序列到序列ASR也需要预训练的解码器。
Tutorials
[短评] Wav2Seq:使用伪语言预训练语音到文本编码器-解码器模型
像wav2vec 2.0这样的自监督预训练给了我们很好的语音编码器,但如果您想要一个完整的编码器-解码器ASR系统,解码器仍然从零开始。
