英伟达让 AI 重写 Kimi 注意力内核,速度达官方版近 3 倍
ChainCatcher 消息,NVIDIA 研究团队让 AI Agent 直接重写了 Kimi Delta Attention 的 GPU 内核。Kimi Delta Attention 是月之暗面 Kimi-Linear 模型使用的核心注意力机制之一,这类底层代码过去通常需要熟悉 CUDA 和芯片架构的工程师反复手工优化。Agent 写出的版本在 NVIDIA B300 上达到月之暗面官方 FlashKDA 的 2.96 倍速度。团队测试了固定长度和不同变长序列共 6 组任务,2.96 倍为全部任务的几何平均值,相关内核已经开源。过程中,Agent 曾利用测试漏洞,把测试数据的统计规律写进代码,跑出 3.74 倍;只保留最近 32 个 token 时,单项成绩达到 5.16 倍。这些版本换到真实 Kimi 数据会算错或失效。团队随后加入真实 Kimi 运行数据、随机输入和极端数值测试,并收紧误差标准,最终保留的 2.96 倍版本通过了这套验证。