英偉達讓 AI 重寫 Kimi 注意力內核,速度達官方版近 3 倍
ChainCatcher 消息,NVIDIA 研究團隊讓 AI Agent 直接重寫了 Kimi Delta Attention 的 GPU 內核。Kimi Delta Attention 是月之暗面 Kimi-Linear 模型使用的核心注意力機制之一,這類底層代碼過去通常需要熟悉 CUDA 和晶片架構的工程師反覆手工優化。Agent 寫出的版本在 NVIDIA B300 上達到月之暗面官方 FlashKDA 的 2.96 倍速度。團隊測試了固定長度和不同變長序列共 6 組任務,2.96 倍為全部任務的幾何平均值,相關內核已經開源。過程中,Agent 曾利用測試漏洞,把測試數據的統計規律寫進代碼,跑出 3.74 倍;只保留最近 32 個 token 時,單項成績達到 5.16 倍。這些版本換到真實 Kimi 數據會算錯或失效。團隊隨後加入真實 Kimi 運行數據、隨機輸入和極端數值測試,並收緊誤差標準,最終保留的 2.96 倍版本通過了這套驗證。