Команда DeepReinforce анонсировала новую систему CUDA L2, способную автоматически генерировать GPU код для матричного умножения с эффективностью, превышающей традиционные библиотеки cuBLAS и cuBLASLt на 10-30%. Эти библиотеки, разработанные специалистами NVIDIA, служат эталоном в оптимизации, и такой результат вызывает большой интерес в отрасли.
CUDA L2 отличается от привычных методов, применяя комбинацию большой языковой модели и обучения с подкреплением. LLM создает CUDA ядро под конкретные размеры матриц, затем цикл RL тестирует код на реальном оборудовании, оценивая его производительность и корректность. Этот процесс продолжается до получения наилучшего результата, что позволяет избежать человеческих шаблонов и гибко изменять ключевые аспекты ядра.
Использование модели DeepSeek 671B с дополнительным обучением на высококачественном коде способствует обработке множества реальных матричных конфигураций, что расширяет область применения технологии. Тесты показывают, что в оффлайн-режиме CUDA L2 работает на 17-22% быстрее, а в серверных сценариях — на 24-29% быстрее, что существенно снижает затраты на обучение моделей.
Команда планирует расширить методы на новые архитектуры и поддерживать различные вариации HGEMM, что может установить новый стандарт в оптимизации, где языковые модели станут полноценными инженерами по производительности.