Tutorials
[长评] 经过微调的语言模型是零样本学习器
在 InstructGPT 将指令微调变成家喻户晓的术语之前,Google 的 FLAN 论文主张,通过对自然语言指令进行适度的多任务微调,可以将一个普通的 LM 变成一个出人意料的 c
Tutorials
[长评] 'GShard':使用条件计算和自动分片扩展巨大模型
将 Transformer 扩展到数千亿参数以上会很快变成哲学问题:你是激活整个网络来处理每个 token,还是将每个 token 路由给真正需要看到它的专家?
