BTC $79,592.03 +1.54%
ETH $2,511.51 +1.60%
BNB $750.70 -0.09%
XRP $1.44 +2.94%
SOL $104.73 +1.54%
TRX $0.3388 +0.02%
DOGE $0.0914 +2.27%
ADA $0.2208 +0.97%
BCH $259.54 +1.29%
LINK $12.20 -2.71%
HYPE $86.85 +4.38%
AAVE $129.36 +0.02%
SUI $0.8192 +0.65%
XLM $0.1894 +0.66%
ZEC $1,265.47 +8.89%
BTC $79,592.03 +1.54%
ETH $2,511.51 +1.60%
BNB $750.70 -0.09%
XRP $1.44 +2.94%
SOL $104.73 +1.54%
TRX $0.3388 +0.02%
DOGE $0.0914 +2.27%
ADA $0.2208 +0.97%
BCH $259.54 +1.29%
LINK $12.20 -2.71%
HYPE $86.85 +4.38%
AAVE $129.36 +0.02%
SUI $0.8192 +0.65%
XLM $0.1894 +0.66%
ZEC $1,265.47 +8.89%

olmo

Tất cả
Bài viết
Tin nhanh

first_img Nghiên cứu: Sự cải thiện hiệu suất tiền huấn luyện từ năm 2019 đến 2025 chủ yếu đến từ dữ liệu

Dwarkesh Patel và Jerry Han đã công bố nghiên cứu vào ngày 8 tháng 9 năm 2026, phân tích những đóng góp của dữ liệu và cải tiến mô hình trong tiến trình tiền huấn luyện từ năm 2019 đến 2025. Nghiên cứu được thực hiện trên quy mô nhỏ, tập trung vào tiền huấn luyện, với các công thức mô hình và dữ liệu công khai tương ứng với từng năm, và được huấn luyện trên quy mô tính toán lên tới 1e19 FLOPs.Kết quả cho thấy, dưới ngân sách tính toán 1e19 FLOPs, lợi ích về hiệu suất tính toán từ cải tiến dữ liệu là 12.0 lần, cải tiến mô hình là 3.7 lần, lợi ích từ phía dữ liệu khoảng 3.24 lần so với phía mô hình. Lợi ích từ cải tiến dữ liệu và mô hình chủ yếu độc lập, gần như không tương tác, hiệu ứng cộng tính của cả hai có thể giải thích 88% phương sai của điểm OLMES dưới mô hình tuyến tính.Phía mô hình đã tiến hóa từ GPT-2 đến OLMo-2, bao gồm các bộ tối ưu, mã hóa vị trí, chuẩn hóa, hàm kích hoạt và khởi tạo. Phía dữ liệu đã tiến hóa từ khoảng 9 tỷ token của OpenWebText vào năm 2019, đến các tập dữ liệu lớn hơn và được lọc tinh vi hơn như UltraFineWeb vào năm 2025.
app_icon
ChainCatcher Building the Web3 world with innovations.