Эволюция алгоритмов FlashAttention: от Hopper до Blackwell
D@deep_schoolAI-инженер
1 месРазбор архитектурных изменений в FlashAttention-3 и FlashAttention-4 для оптимизации работы на GPU архитектур Hopper и Blackwell.
FlashAttention-3 и FlashAttention-4 — пример того, как алгоритмы нужно заново адаптировать под каждое поколение GPU 🚀
В новой статье разбираем, почему FlashAttention-2 отлично работал на Amper'е, но уже не раскрывал потенциал архитектур Hopper и Blackwell и какие архитектурные изменения вновь ускорили attention.
Вы узнаете:
• почему на H100 FA-2 просел по утилизации GPU
• как Tensor Memory Accelerator и асинхронные Tensor Cores ускорили FA-3
• зачем нужна warp-специализация
• как matmul и softmax удалось выполнять параллельно
• что даёт FP8 с контролем ошибок
• и почему для Blackwell снова понадобилась перестройка во FlashAttention-4
Читайте разбор по ссылке! 👈🏼
Кратко (AI)
Автор статьи анализирует необходимость адаптации алгоритма FlashAttention под новые поколения графических процессоров NVIDIA. В материале объясняется, почему предыдущие версии алгоритма теряли эффективность на архитектурах Hopper и Blackwell, и какие технические решения, включая использование Tensor Memory Accelerator и FP8, позволили ускорить вычисления.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖