chunk_kda
• GB200: до 3,27× на variable-length sequences
• поддерживается batching последовательностей разной длины
• интеграция уже есть в flash-linear-attention ≥ 0.5.0 — FlashKDA может автоматически выбираться как backend
Требования пока серьёзные: SM90+, CUDA 12.9+ и PyTorch 2.4+.
Интересно здесь другое: вместе с моделями Moonshot постепенно открывает и низкоуровневый стек, необходимый для быстрого запуска их архитектур.
🔗 https://github.com/MoonshotAI/FlashKDAMoonshot AI представила FlashKDA для ускорения Kimi Delta Attention
M@machinelearning_interviewAI-инженер
1 месMoonshot AI выпустила FlashKDA — оптимизированные CUDA-ядра для ускорения Kimi Delta Attention на GPU NVIDIA.
Это ускоряет работу нейросетей на современном железе, снижая затраты на вычисления.
- Значительное ускорение обработки длинных последовательностей на GPU NVIDIA.
- Поддержка пакетной обработки данных разной длины повышает эффективность использования видеокарт.
- Открытый исходный код позволяет разработчикам внедрять эти оптимизации в свои проекты.
⚡️ Moonshot AI открыла FlashKDA - быстрые CUDA-ядра для Kimi Delta Attention
FlashKDA — реализация KDA на базе CUTLASS, заточенная под современные GPU NVIDIA.
По бенчмаркам разработчиков:
• H20: ускорение примерно до 2,31× относительно

Кратко (AI)
Компания Moonshot AI представила FlashKDA — библиотеку с оптимизированными CUDA-ядрами для ускорения механизма Kimi Delta Attention. Решение обеспечивает значительный прирост производительности на GPU NVIDIA H20 и GB200 и уже интегрировано в пакет flash-linear-attention.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖