[Long Review] 훈련 데이터 중복 제거가 언어 모델을 더 좋게 만든다
중복 제거는 지루해 보이지만, C4 내에 61개 단어로 된 문장이 60,000번 이상 나타나고, 이런 말뭉치로 훈련된 언어 모델이 훈련 세트 텍스트를 불안하게 re
중복 제거는 지루해 보이지만, C4 내에 61개 단어로 된 문장이 60,000번 이상 나타나고, 이런 말뭉치로 훈련된 언어 모델이 훈련 세트 텍스트를 불안한 규칙성으로 사용자에게 돌려준다는 것을 알게 될 때까지. Google 논문 "Deduplicating Training Data Makes Language Models Better"의 이 장문 리뷰는 거의 중복 탐지와 긴 부분 문자열 일치가 어떻게 손실 풍경, 기억화 행동, 그리고 현대 LLM의 평가 타당성을 재구성하는지 파헤친다.
제안된 두 개의 중복 제거 파이프라인, 이들을 웹 규모에서 다룰 수 있게 하는 접미사 배열 트릭, 그리고 더 깨끗한 데이터가 10배 적은 기억화와 동일하거나 더 나은 정확도로의 더 빠른 수렴을 생성한다는 경험적 증거에 대해 신중하게 살펴보세요. 대화를 위해 LLM을 미세 조정하는 음성 AI 실무자, 또는 서기 집중적인 말뭉치에서 음성 기초 모델을 훈련하는 사람들을 위해, 메시지는 직접 적용됩니다: 누출된 평가 문장과 복사 붙여넣기 생성은 중복 훈련 행에서 시작합니다. 데이터 파이프라인 결정이 당신의 책상에 떨어진다면 깊이 있는 분석은 당신의 오후의 가치가 있습니다.
