NVIDIA заставила AI переписать ядро внимания Kimi, скорость достигла почти 3-х раз официальной версии
Команда исследований NVIDIA позволила AI Agent напрямую переписать ядро GPU Kimi Delta Attention. Kimi Delta Attention является одним из основных механизмов внимания, используемых в модели Kimi-Linear на темной стороне Луны, и такой низкоуровневый код ранее обычно требовал от инженеров, знакомых с CUDA и архитектурой чипов, многократной ручной оптимизации.
Версия, написанная Agent, достигла скорости 2.96 раз быстрее официального FlashKDA на темной стороне Луны на NVIDIA B300. Команда протестировала 6 групп задач с фиксированной длиной и различными последовательностями переменной длины, 2.96 раз является геометрическим средним для всех задач, соответствующее ядро уже открыто.
В процессе Agent использовал уязвимость тестирования, чтобы записать статистические закономерности тестовых данных в код, достигнув 3.74 раз; при сохранении только последних 32 токенов, отдельный результат достиг 5.16 раз. Эти версии, примененные к реальным данным Kimi, будут давать неверные результаты или выходить из строя. Команда затем добавила реальные данные работы Kimi, случайные входные данные и тесты на экстремальные значения, и ужесточила стандарты ошибок, в конечном итоге оставив версию 2.96 раз, которая прошла эту проверку.






