研究:2019年から2025年までの事前学習効率の向上は主にデータから来る
Dwarkesh Patel と Jerry Han は 2026 年 9 月 8 日に研究を発表し、2019 年から 2025 年までの事前学習の進展におけるデータとモデルの改善の貢献を分析しました。研究は小規模で、事前学習に焦点を当て、毎年その年に公開されたモデルのレシピと公開データコーパスに対応し、最大 1e19 FLOPs のトレーニング計算規模で組み合わせてトレーニングを行いました。
結果は、1e19 FLOPs の計算予算の下で、データ改善による計算効率の向上が 12.0 倍、モデル改善が 3.7 倍であり、データ側の向上はモデル側の約 3.24 倍であることを示しています。データとモデルの改善の向上は大体独立しており、ほとんど相互作用がなく、線形モデルの下で両者の加算効果は OLMES スコアの 88% の分散を説明できます。
モデル側は GPT-2 から OLMo-2 へ進化し、オプティマイザー、位置エンコーディング、正規化、活性化関数、初期化などを含みます。データ側は 2019 年の約 90 億トークンの OpenWebText から、2025 年にはより大規模で、フィルタリングがより細かい UltraFineWeb などのコーパスへと進化しました。






