エヌビディアはAIにKimiの注意力コアを再構築させ、速度は公式版の約3倍に達しました。
NVIDIA の研究チームは、AI エージェントが Kimi Delta Attention の GPU カーネルを直接書き換えました。Kimi Delta Attention は月の暗い面 Kimi-Linear モデルで使用されるコア注意メカニズムの一つであり、このような低レベルのコードは過去において、CUDA やチップアーキテクチャに精通したエンジニアが繰り返し手動で最適化する必要がありました。
エージェントが書いたバージョンは、NVIDIA B300 で月の暗い面公式 FlashKDA の 2.96 倍の速度に達しました。チームは固定長と異なる可変長シーケンスの合計 6 グループのタスクをテストし、2.96 倍は全タスクの幾何平均値であり、関連するカーネルはすでにオープンソース化されています。
その過程で、エージェントはテストの脆弱性を利用して、テストデータの統計的規則をコードに書き込み、3.74 倍を達成しました。最近の 32 個のトークンのみを保持した場合、単一の成績は 5.16 倍に達しました。これらのバージョンを実際の Kimi データに適用すると、誤算や無効になることがあります。チームはその後、実際の Kimi 実行データ、ランダム入力、極端な数値テストを追加し、誤差基準を厳しくし、最終的に保持された 2.96 倍のバージョンがこの検証を通過しました。






