cudaСбросить фильтр ×

Prime Flash MoE: оптимизированные кернелы для архитектуры Blackwell

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 3 дн назад

Компания Prime Intellect представила Prime Flash MoEi — специализированный fused-кернелi, предназначенный для ускорения работы моделей с архитектурой Mixture-of-Experts (MoE) на графических процессорах NVIDIA Blackwell.

Решение направлено на устранение узких мест при работе с памятью и синхронизацией потоков, что позволяет значительно повысить производительность вычислений по сравнению со стандартными методами PyTorch.

20%прирост скорости в формате bf16
2 разаускорение в формате mxfp8

Полный разбор →

Обзор блога Simon Veitner по оптимизации GPU-кернелов

К@quant_prune_distillAI-инженер
6 дн
Наткнулся на интересный блог от некоего Simon Veitner. Дизайн суровый, минималистичный, максимально дешево и сердито, но есть немало интересных статей про написание и ускорение кернелов, компоненты современных GPU, а также реализации различных алгоритмов в CuTe / CuTeDSL . В частности: • Making RMSNorm really fastMaking matrix transpose really fast on Hopper GPUsCuTeDSL on Hopper - WGMMA and TMA intro Будет полезно интересующимся написанием кернелов и эффективными программными реализациями алгоритмов на видеокартах, в особенности, на архитектурах Hopper и Blackwell.

Прохождение курса Language Modeling from Scratch

Т@tech_priestessAI-инженер
6 дн

Лаба Song Han из MIT выпустила агентский скилл для оптимизации CUDA-кернелов под Hopper и Blackwell

Лаборатория Song Han (MIT), известного специалиста по эффективному глубокому обучению, опубликовала репозиторий со скиллом для AI-агентов, предназначенным для оптимизации кернеловi под архитектуры Hopperi и Blackwelli.

Скилл содержит набор скриптов, которые позволяют агенту самостоятельно обращаться к базам знаний, блогам, PR'ам и другим артефактам, посвящённым тензорным ядрам и архитектурным особенностям Hopper и Blackwell — то есть автоматизирует часть рутинной работы по низкоуровневой оптимизации GPU-кода.

Полный разбор →

Moonshot AI представила FlashKDA для ускорения Kimi Delta Attention

1 мес
Moonshot AI представила FlashKDA для ускорения Kimi Delta Attention

Сотрудники Anthropic иронизируют над призывами к открытому коду

D@data_secretsAI-инженер
1 мес
Сотрудники Anthropic тем временем еще и публично подсмеиваются над компаниями, подписавшими письмо 6.1 миллион просмотров набрал твит Julian Schrittweiser. В био у него числится «Member of Technical Staff at Anthropic». Разработчик недвусмысленно поиздевался над Хуангом, «поздравив» его с обретением веры в открытый код, и добавив, что ждет опенсорса CUDA и GPU. Под этим же твиттом он также обратился к Сатье Наделла. «Я также жду опенсорса Windows и MS Office!». Давайте дружно поможем антропикам найти хорошего кризис-менеджера, он им пригодится 🙏
Сотрудники Anthropic иронизируют над призывами к открытому коду

Почему Python стал стандартом в машинном обучении

Х@habr_comмедиа / агрегатор
1 мес

Адаптация драйверов Nvidia для Windows ARM

P@prohitecавтор про «tech»
1 мес
Китайцы адаптировали драйвер Nvidia ARM на Windows ARM, для других платформ. Пока использование ограниченно, но удалось запустить RTX 4060 на платформе Huawei и RTX 2080 Ti на плате Radxa ARM. Производители этих систем не поддерживают Windows официально, поэтому сложности все равно остались, и поддержка не такая как хотелось бы. В играх производительность низкая, а вот софт, в данном случае Blender, подхватывает видюхи для работы с CUDA.

Spectral Compute адаптировал CUDA для ускорителей AMD

3@ru3dnewsавтор про «tech»
1 мес
Стартап Spectral Compute адаптировал CUDA под ускорители AMD — лучше, чем сама AMD Лондонский стартап Spectral Compute сделал свой компилятор CUDA, который на видеокартах AMD работает даже лучше, чем родные инструменты самой AMD. Ребята фактически говорят: в мире ИИ и супервычислений рулит не железо Nvidia, а её софт — экосистема CUDA. И если заставить CUDA нормально бегать на AMD, у разработчиков появится реальная альтернатива. Это удар не только по Nvidia, но и по стратегии самой AMD, которая продвигает свои собственные инструменты. #nvidia #cuda #компиляторы 📎Подробнее 🔖 3DNews в TG | MAX | VK

Обзор книги GPU-Accelerated Computing with Python 3 and CUDA

D@datastorieslanguagesAI-инженер
1 мес

audio.cpp: высокопроизводительный C++ движок для аудиоинференса

Н@GreenNeuralRobotsAI-инженер
1 мес
audio.cpp C++ движок для аудиоинференса на ggml. заявлен прирост 1.8–5x по сравнению с Python‑реализациями, плюс есть оптимизация под CUDA. - синтез речи. - распознавание речи. - VAD (Voice Activity Detection) - детекция голосовой активности. - конвертация голоса (изменение тембра, пола и т. д.). - генерация музыки/аудиофрагментов Windows / Linux / macOS #tts #stt #vad #t2m #text2music #voice2voice

Это всё на сейчас.