Исследование: повышение эффективности предварительного обучения с 2019 по 2025 год в основном связано с данными
Дваркеш Патель и Джерри Хан опубликовали исследование 8 сентября 2026 года, в котором разобрали вклад данных и улучшений моделей в прогресс предобучения с 2019 по 2025 год. Исследование проводилось на меньшем масштабе, сосредоточенном на предобучении, с ежегодным соответствием открытым рецептам моделей и открытым корпусам данных, и комбинированным обучением на вычислительном масштабе до 1e19 FLOPs.
Результаты показывают, что при вычислительном бюджете в 1e19 FLOPs прирост вычислительной эффективности от улучшения данных составляет 12.0 раз, улучшение моделей — 3.7 раз, а прирост со стороны данных примерно в 3.24 раза больше, чем со стороны моделей. Прирост от улучшения данных и моделей в целом независим и почти не взаимодействует, линейная модель объясняет аддитивный эффект обоих факторов на 88% дисперсии OLMES.
Сторона моделей эволюционировала от GPT-2 до OLMo-2, охватывая оптимизаторы, позиционное кодирование, нормализацию, функции активации и инициализацию. Сторона данных эволюционировала от примерно 9 миллиардов токенов OpenWebText в 2019 году до более крупного и более тщательно отфильтрованного корпуса UltraFineWeb в 2025 году.






