FlashAttention-3 и FlashAttention-4 — пример того, как алгоритмы нужно заново адаптировать под каждое поколение GPU 🚀
В новой статье разбираем, почему FlashAttention-2 отлично работал на Amper'е, но уже не раскрывал потенциал архитектур Hopper и Blackwell и какие архитектурные изменения вновь ускорили attention.
Вы узнаете:
• почему на H100 FA-2 просел по утилизации GPU
• как Tensor Memory Accelerator и асинхронные Tensor Cores ускорили FA-3
• зачем нужна warp-специализация
• как matmul и softmax удалось выполнять параллельно
• что даёт FP8 с контролем ошибок
• и почему для Blackwell снова понадобилась перестройка во FlashAttention-4
Читайте разбор
по ссылке! 👈🏼