← к ленте

Moonshot AI представила FlashKDA для ускорения Kimi Delta Attention

1 мес

Moonshot AI выпустила FlashKDA — оптимизированные CUDA-ядра для ускорения Kimi Delta Attention на GPU NVIDIA.

Это ускоряет работу нейросетей на современном железе, снижая затраты на вычисления.

  • Значительное ускорение обработки длинных последовательностей на GPU NVIDIA.
  • Поддержка пакетной обработки данных разной длины повышает эффективность использования видеокарт.
  • Открытый исходный код позволяет разработчикам внедрять эти оптимизации в свои проекты.
⚡️ Moonshot AI открыла FlashKDA - быстрые CUDA-ядра для Kimi Delta Attention FlashKDA — реализация KDA на базе CUTLASS, заточенная под современные GPU NVIDIA. По бенчмаркам разработчиков: • H20: ускорение примерно до 2,31× относительно chunk_kdaGB200: до 3,27× на variable-length sequences • поддерживается batching последовательностей разной длины • интеграция уже есть в flash-linear-attention ≥ 0.5.0 — FlashKDA может автоматически выбираться как backend Требования пока серьёзные: SM90+, CUDA 12.9+ и PyTorch 2.4+. Интересно здесь другое: вместе с моделями Moonshot постепенно открывает и низкоуровневый стек, необходимый для быстрого запуска их архитектур. 🔗 https://github.com/MoonshotAI/FlashKDA
Moonshot AI представила FlashKDA для ускорения Kimi Delta Attention

Кратко (AI)

Компания Moonshot AI представила FlashKDA — библиотеку с оптимизированными CUDA-ядрами для ускорения механизма Kimi Delta Attention. Решение обеспечивает значительный прирост производительности на GPU NVIDIA H20 и GB200 и уже интегрировано в пакет flash-linear-attention.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖