신경 언어 모델을 위한 스케일링 법칙
GPT-3가 스케일링을 필연적으로 느껴지게 하기 전에, 이 OpenAI 논문이 이를 예측 가능하게 만들었습니다.
GPT-3가 스케일링을 필연적으로 느껴지게 하기 전에, 이 OpenAI 논문이 이를 예측 가능하게 만들었습니다. Kaplan과 공저자들은 모델 크기, 데이터셋 크기, 계산 예산에 걸쳐 수백 개의 학습 실행을 수행했으며, 언어 모델 손실이 7개 자리수에 걸쳐 깔끔한 거듭제곱 법칙을 따른다는 것을 발견했습니다. 그 영향은 분야를 재구성했습니다: 고정된 계산 예산이 주어지면, 최적의 모델 크기와 토큰 개수가 있으며, 그것은 대부분 실무자들이 가정했던 것이 아닙니다.
이 안내문은 세 가지 지배적인 양, 아키텍처 세부사항이 생각보다 중요하지 않은 이유, 그리고 논문의 계산 최적 한계가 GPT-3에서 Chinchilla, 현대 음성 기초 모델에 이르기까지 어떻게 모든 것을 안내했는지를 다룹니다. 또한 발표자가 배치 크기 동역학에서 발견한 실수에 대한 주의가 있습니다 — 실험 설정을 신경 쓴다면 들을 가치가 있습니다. 훈련 예산을 정당화하거나 더 큰 것이 정말 여기서 더 낫다고 이해관계자에게 설명해야 한다면, 이것은 많은 손 흔들림을 절약해주는 기초 자료입니다. 대기열에 올리세요.
