[Short Review] 훈련 데이터 중복 제거가 언어 모델을 더 좋게 만든다
당신의 언어 모델의 "일반화" 중 얼마나 많은 부분이 실제로는 단순한 반복일까요?
당신의 언어 모델의 "일반화" 중 얼마나 많은 부분이 실제로는 단순한 반복일까요? Google Research가 숫자를 제시했습니다: 프롬프트 없는 LM 출력의 1% 이상이 훈련 데이터에서 그대로 복사되고, C4와 같은 표준 말뭉치는 수만 번 반복되는 문장을 포함합니다. 그들의 논문은 웹 규모 데이터 세트에서 거의 중복되고 긴 반복 부분 문자열을 제거하는 두 개의 효율적인 중복 제거 도구를 소개하며, 놀라운 하위 효과가 있습니다.
정리된 데이터로 훈련된 모델은 10배 적게 기억하고, 더 적은 단계로 수렴하며, 훈련-테스트 겹침이 급격히 떨어지기 때문에 더 신뢰할 수 있는 평가 숫자를 생성합니다. 대화형 에이전트를 위한 LLM 백엔드를 구축하거나 스크래핑된 필사본에서 음성-언어 모델을 훈련하는 음성 AI 팀들을 위해, 이는 데이터 세트 위생이 종종 아키텍처 우수성을 이기는 것을 상기시킵니다. 이 짧은 리뷰는 중복 제거 알고리즘, 기억화 측정, 그리고 공개된 코드를 다룹니다. 데이터 품질이 다음 스프린트 근처에 있다면 5분의 가치가 있습니다.
