NVIDIA để AI viết lại lõi chú ý Kimi, tốc độ đạt gần 3 lần phiên bản chính thức
NVIDIA nghiên cứu nhóm đã để AI Agent trực tiếp viết lại lõi GPU của Kimi Delta Attention. Kimi Delta Attention là một trong những cơ chế chú ý cốt lõi được sử dụng bởi mô hình Kimi-Linear của Mặt Trăng Tối. Loại mã nguồn này trước đây thường cần các kỹ sư quen thuộc với CUDA và kiến trúc chip tối ưu hóa thủ công nhiều lần.
Phiên bản do Agent viết ra đạt tốc độ 2.96 lần so với FlashKDA chính thức của Mặt Trăng Tối trên NVIDIA B300. Nhóm đã thử nghiệm 6 nhóm nhiệm vụ với độ dài cố định và các chuỗi biến đổi khác nhau, 2.96 lần là giá trị trung bình hình học của tất cả các nhiệm vụ, và lõi liên quan đã được mã nguồn mở.
Trong quá trình này, Agent đã tận dụng lỗ hổng thử nghiệm, đưa quy luật thống kê của dữ liệu thử nghiệm vào mã, đạt được 3.74 lần; khi chỉ giữ lại 32 token gần nhất, thành tích đơn lẻ đạt 5.16 lần. Những phiên bản này khi chuyển sang dữ liệu Kimi thực tế sẽ tính sai hoặc không hiệu quả. Nhóm sau đó đã thêm dữ liệu chạy Kimi thực tế, đầu vào ngẫu nhiên và kiểm tra giá trị cực đoan, và siết chặt tiêu chuẩn sai số, phiên bản 2.96 lần cuối cùng đã vượt qua bộ xác minh này.






