[长篇评论] 数据去重使语言模型更好
数据去重听起来很无聊,直到你了解到一个61词的句子在C4中出现了超过60,000次,以及用这些语料库训练的语言模型会以令人不安的方式向用户吐出训练集中的文本
数据去重听起来很无聊,直到你了解到一个61词的句子在C4中出现了超过60,000次,以及用这些语料库训练的语言模型会以令人不安的规律性向用户吐出训练集中的文本。这篇关于Google论文《数据去重使语言模型更好》的长篇评论深入探讨了近似重复检测和长子串匹配如何重塑损失景观、记忆化行为和现代LLM的评估有效性。
期待仔细了解两个提议的去重管道、使其在网络规模上可行的后缀数组技巧以及表明更清洁数据产生十倍更少的记忆化加上更快收敛到相等或更好准确性的经验证据。对于微调LLM进行对话或在转录密集语料库上训练语音基础模型的语音AI从业者来说,该信息直接转化为:泄露的评估句子和复制粘贴生成始于重复的训练行。如果数据管道决策落在你的任务上,深度探讨值得你花一下午时间。
