연구: 2019년부터 2025년까지 사전 훈련 효율성 향상은 주로 데이터에서 비롯된다
Dwarkesh Patel과 Jerry Han은 2026년 9월 8일 연구를 발표하여 2019년부터 2025년까지의 사전 훈련 진행에서 데이터와 모델 개선의 기여를 분석했습니다. 연구는 소규모로 진행되며, 매년 공개된 모델 레시피와 공개 데이터 코퍼스에 맞춰 사전 훈련을 수행하고, 최대 1e19 FLOPs의 훈련 계산 규모에서 조합 훈련을 진행했습니다.
결과는 1e19 FLOPs 계산 예산 하에 데이터 개선이 가져온 계산 효율성 증가는 12.0배, 모델 개선은 3.7배, 데이터 측의 증가는 모델 측의 약 3.24배임을 보여줍니다. 데이터와 모델 개선의 증가는 대체로 독립적이며 거의 상호작용이 없고, 선형 모델 하에서 두 가지의 가법적 효과는 OLMES 점수의 88% 분산을 설명할 수 있습니다.
모델 측은 GPT-2에서 OLMo-2로 발전하며 최적화기, 위치 인코딩, 정규화, 활성화 함수 및 초기화 등을 포함합니다. 데이터 측은 2019년 약 90억 토큰의 OpenWebText에서 2025년 규모가 더 크고 필터링이 더 정교한 UltraFineWeb 등의 코퍼스로 발전합니다.






