Tutorials
[短评] 完全分片数据并行:用更少的GPU进行更快的AI训练
完全分片数据并行是Meta对每个语音和语言团队最终都会提出的问题的答案:我们如何能够训练大一个数量级的模型,而无需配置大一个数量级的GPU?
Tutorials
[长篇评论] 数据去重使语言模型更好
数据去重听起来很无聊,直到你了解到一个61词的句子在C4中出现了超过60,000次,以及用这些语料库训练的语言模型会以令人不安的方式向用户吐出训练集中的文本
