研究:2019 至 2025 年預訓練效率提升主要來自數據
ChainCatcher 消息,Dwarkesh Patel 與 Jerry Han 於 2026 年 9 月 8 日發布研究,拆解 2019 至 2025 年預訓練進展中數據與模型改進的貢獻。研究在較小規模、針對預訓練進行,每年對應當年公開的模型配方與公開數據語料,並在最高 1e19 FLOPs 的訓練計算規模上組合訓練。
結果顯示,在 1e19 FLOPs 計算預算下,數據改進帶來的計算效率增益為 12.0 倍,模型改進為 3.7 倍,數據側增益約為模型側的 3.24 倍。數據與模型改進的增益大體獨立、幾乎不交互,線性模型下二者加性效應可解釋 OLMES 分數 88% 的方差。
模型側從 GPT-2 演進至 OLMo-2,涵蓋優化器、位置編碼、歸一化、激活函數與初始化等。數據側從 2019 年約 90 億 token 的 OpenWebText,演進至 2025 年規模更大、過濾更精細的 UltraFineWeb 等語料。






