gpuСбросить фильтр ×

AMD готовит флагманскую GPU на архитектуре RDNA 5

I@itcnewsruавтор про «tech»
13 ч
AMD готовит видеокарту, которая может обойти RTX 5090 на 60% По словам инсайдера Moore’s Law Is Dead, флагманская GPU на архитектуре RDNA 5 получит в 3–4 раза больше вычислительных блоков, чем RX 9070 XT, а пропускная способность памяти вырастет примерно в четыре раза. Переход на 3-нм техпроцесс TSMC позволит удержать энергопотребление в пределах 350–450 Вт. При этом, по прогнозу инсайдера, топовая AMD сможет оказаться на 30–60% быстрее RTX 5090 и при этом стоить дешевле. Если прогнозы подтвердятся, Nvidia придётся серьёзно конкурировать с AMD уже в следующем поколении.
AMD готовит флагманскую GPU на архитектуре RDNA 5

Т1: рост рынка ИИ в России ограничен дефицитом инфраструктуры

З@zatelecomавтор про «it»
вчера

Prime Flash MoE: оптимизированные кернелы для архитектуры Blackwell

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 3 дн назад

Компания Prime Intellect представила Prime Flash MoEi — специализированный fused-кернелi, предназначенный для ускорения работы моделей с архитектурой Mixture-of-Experts (MoE) на графических процессорах NVIDIA Blackwell.

Решение направлено на устранение узких мест при работе с памятью и синхронизацией потоков, что позволяет значительно повысить производительность вычислений по сравнению со стандартными методами PyTorch.

20%прирост скорости в формате bf16
2 разаускорение в формате mxfp8

Полный разбор →

Инженер из Software Mansion показал ИИ-подсветку в реальном времени на основе карты глубины

Конрад Речко (@reczko_konrad), инженер из польской компании Software Mansion, представил демо, где виртуальный источник света в кадре с веб-камеры «понимает» глубину сцены и может огибать человека, скрываясь за поднятой рукой или плечом ровно в нужный момент — без единой задержки, как настоящее освещение.

Весь пайплайн — от нейросети, вычисляющей карту глубины, до финального рендера со светом — работает целиком на GPU в браузере, без пересылки данных между CPU и GPU. Проект собрал 7.4 млн просмотров за сутки и стал ML-проектом недели по версии Data Secrets.

7.4 миллионапросмотров за сутки
~8 мсвремя обработки кадра на M4 Pro
~16.7 мсдлительность кадра при 60 fps

Полный разбор →

Сравнение стоимости использования скафолдов для GPU-задач

Б@boris_againAI-инженер
5 дн
я ненавижу скафолды от модельных лаб. Опуская вопрос что они убогие, так они еще и закрытые, так еще и едят кредиты как фантики(ладно очевидно это фича). В связи с преждевременной кончиной лимитов я решил померить сколько каждый из скафолдов кушает на разных моделях: - Sol 5.6 medium - Kimi k3 high Собственно идея такая: есть задачка написать 3 body проблем для GPU и покрутить на gpu численную симуляцию, все модели справились НО pi agent стоит в 4! раза дешевле чем все соседи смотреть pr cмотреть логи
Сравнение стоимости использования скафолдов для GPU-задач

Обзор блога Simon Veitner по оптимизации GPU-кернелов

К@quant_prune_distillAI-инженер
6 дн
Наткнулся на интересный блог от некоего Simon Veitner. Дизайн суровый, минималистичный, максимально дешево и сердито, но есть немало интересных статей про написание и ускорение кернелов, компоненты современных GPU, а также реализации различных алгоритмов в CuTe / CuTeDSL . В частности: • Making RMSNorm really fastMaking matrix transpose really fast on Hopper GPUsCuTeDSL on Hopper - WGMMA and TMA intro Будет полезно интересующимся написанием кернелов и эффективными программными реализациями алгоритмов на видеокартах, в особенности, на архитектурах Hopper и Blackwell.

AMD представила ускоритель Instinct MI350P в форм-факторе PCIe

т@techn0danyaAI-инженер
1 нед
AMD представила ускоритель Instinct MI350P в форм-факторе PCIe

Тестирование производительности Qwen 3.8 27B на разных конфигурациях GPU

Г@gmorevaAI-инженер
1 нед

Оптимизация инференса MoE моделей через Warp Decode от Cursor

К@quant_prune_distillAI-инженер
1 нед

Mistral AI запускает облачную платформу и добавляет модель GLM-5.2

C@cyberyozh_officialAI-инженер
1 нед

Вопрос о производительности квантованных моделей и шине PCI-E

T@extremecodeAI-инженер
1 нед
Эксперты из каментов, я с этими бенчмарками скоро с ума сойду. Почему так ёпта? PCI-E 4 / x4, на ЖПУ также только 4 линии распаяно. В теории должны упираться в шину, какого хрена iMatrix, и уж тем более 8-и битки быстрее, чем очереднярные Q4? Все в интернетах пишут типа, "АРРРЯЯ IQ медленные", какого хрена у меня они стабильно быстрее? Даже на нормальной жпу в pcie5 со всеми линиями (скрин в каменты к посту закину) Параметры бенча дефолтные [--fit-target 1024], контекст 512 на pp, и 128 на tg
Вопрос о производительности квантованных моделей и шине PCI-E

NVIDIA превращает GPU в залоговый актив и привлекает $500 млрд от Уолл-стрит

NVIDIA договорилась с крупнейшими инвестфондами Уолл-стрит — BlackRock, Blackstone, Goldman Sachs, Apollo и другими — о создании системы финансирования на $500 млрд для строительства ИИ-инфраструктуры. Финансисты начали рассматривать серверы с GPU как высоколиквидный залоговый актив, наравне с недвижимостью, и готовы выдавать под них крупные кредиты.

CEO NVIDIA Дженсен Хуанг объявил об этом в своём первом лонгриде в X под названием «Вычислительные мощности ИИ-фабрик становятся инвестиционным классом активов». Разработчикам ИИ и облачным сервисам больше не придётся искать собственный капитал на покупку оборудования — постройку ЦОД профинансируют фонды, зарабатывающие затем на аренде мощностей. Так NVIDIA создаёт финансовый механизм, гарантирующий устойчивый спрос на свои чипы.

$500 млрдобъём фонда финансирования ИИ-инфраструктуры
$1.70 → $2.35рост цены аренды H100 за GPU-час (окт.2025–март.2026)
$5.30–$7.05цена аренды B200 за GPU-час в облаке

Полный разбор →

NVIDIA выпустила открытую модель Nemotron 3.5 Lightning для ИИ-агентов

NVIDIA представила открытую модель Nemotron 3.5 Lightning — решение на архитектуре MoEi (30 млрд параметров, 3 млрд активных), созданное специально для работы ИИ-агентов: рутинных задач, программирования и вызова инструментов. Модель работает в связке с более мощными моделями через систему маршрутизации.

По заявлениям NVIDIA, Nemotron 3.5 Lightning выполняет агентские сценарии до 4 раз быстрее аналогов, держит постоянную нагрузку и может запускаться как на дорогих системах DGX Spark, так и на локальных потребительских GPU уровня GeForce RTX 5090 — то есть позиционируется как экономичная альтернатива для массового использования агентов.

30 млрдобщее число параметров модели
3Bактивных параметров (MoE)
86%точность на PinchBench

Полный разбор →

MSI Afterburner v4.6.7 Beta 4 добавляет V/F-карту попаданий и плагин GPUProbe

P@prohitecавтор про «tech»
2 нед
MSI Afterburner v4.6.7 Beta 4 добавляет V/F-карту попаданий и плагин GPUProbe

Локальные LLM в бытовой технике

E@ProductsAndStartupsAI-инженер
2 нед
Ну то, что я людям пишу ultrathink, вы уже знаете… Но сегодня я захотел у духовки спросить: проверь плиз, готова ли курица 🤦🏽 А потом подумал: когда появятся бытовые приборы с локальными LLM модельками и такими интерфейсами, интересно? Что тогда станет со спросом на gpu и какой именно gpu это будет?

Цены на ускорители NVIDIA CMP 170HX выросли из-за утилиты для разблокировки

P@prohitecавтор про «tech»
3 нед
Цены на ускорители NVIDIA CMP 170HX выросли из-за утилиты для разблокировки

NVIDIA разрабатывает технологию расширения видеопамяти через SSD

Н@GreenNeuralRobotsAI-инженер
3 нед
По слухам, NVIDIA разрабатывает технологию использования SSD в качестве расширения видеопамяти. Это позволит запускать крупные нейросети на босяцких GPU Данные, не помещающиеся в основную GDDR7-память, будут храниться на SSD и подгружаться по требованию. Технология будет работать в связке с DirectStorage и RTX IO Энтузиасты уже создали подобный проект GreenBoost (на гитлабе адская процедура регистрации, я не осилил), который позволяет расширить память GPU за счёт SSD и RAM. Система автоматически распределяет данные: горячие слои остаются в VRAM, менее важные — в RAM, а самые редко используемые — на накопителе. #lowvram #gpu #news
NVIDIA разрабатывает технологию расширения видеопамяти через SSD

В драйверы Mesa 26.3 добавлена поддержка AMD GFX1171

P@prohitecавтор про «tech»
3 нед
В драйверы Mesa 26.3 добавили поддержку чипа AMD GFX1171 (RDNA 4m) В графический стек Mesa 26.3 добавили код с поддержкой графического процессора GFX1171 для драйверов RADV (Vulkan) и RadeonSI (OpenGL) который относится к мобильной линейке RDNA 4m. По своей архитектуре RDNA 4m представляет собой гибрид RDNA 3.5 с точечными инструкциями от RDNA 4, что указывает на использование чипа в будущих APU, таких как Medusa Point. Обновление в Mesa задействует для GFX1171 существующие пути драйвера от GFX1170 и интегрированной графики GFX115x (RDNA 3.5). Публичный релиз Mesa 26.3 с изменениями запланирован на четвертый квартал 2026 года.

Snapdragon 8 Elite Gen 6 получит GPU с шестью секциями

P@prohitecавтор про «tech»
3 нед
Snapdragon 8 Elite Gen 6 перейдет на графику с шестью независимыми секциями По данным утечек, GPU новинки разделят на 6 независимых секций вместо 3, которые используются в текущем Snapdragon 8 Elite Gen 5. Обновление архитектуры затронет как базовый чип, так и старшую версию Gen 6 Pro. Секционный подход позволяет распределять шейдерные ядра и блоки фиксированных функций по автономным кластерам с независимой регулировкой частот. Это предотвращает лишний разгон всего чипа при точечных нагрузках. Удвоение числа секций должно заметно повысить энергоэффективность графики и сбалансировать тепловыделение.
Snapdragon 8 Elite Gen 6 получит GPU с шестью секциями

Оптимизация MoE-кернелов: переход от push- к pull-based dispatching

К@quant_prune_distillAI-инженер
3 нед

Kimi K3: китайская MoE-модель на 2,8 трлн параметров с открытыми весами — и скрытая цена «бесплатности»

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 3 нед назад

Китайская компания Moonshot AI выпустила Kimi K3 — MoEi-модель с 2,8 трлн общих и 104 млрд активных параметров, открытыми и бесплатно скачиваемыми весами, native vision и контекстом в 1M токенов. По заявлению авторов, это первая открытая модель 3T-класса, и по многим тестам она приблизилась к топовым закрытым американским моделям, вызвав ажиотаж в индустрии — вплоть до реакции Илона Маска, который назвал релиз «впечатляющим» и сообщил, что xAI готовит ответ на 2 трлн параметров.

Однако «бесплатность» весов не означает дешевизну использования: по официальным рекомендациям Moonshot AI для развёртывания К3 нужна конфигурация «суперузла» из 64+ ускорительных карт, с первоначальными инвестициями порядка 20 млн юаней (~$3 млн), не считая затрат на электроэнергию — что резко ограничивает круг тех, кто реально может запустить модель у себя.

2.8T / 104Bобщие и активные параметры Kimi K3
1M токеновдлина контекста модели
~$3 млн (20 млн юаней)минимальные инвестиции в инфраструктуру для запуска

Полный разбор →

Инженер протестировал TinyGPU v2.0 с 240 тыс. транзисторов

P@prohitecавтор про «tech»
3 нед
Инженер протестировал TinyGPU v2.0 с 240 тыс. транзисторов

Лаба Song Han из MIT выпустила агентский скилл для оптимизации CUDA-кернелов под Hopper и Blackwell

Лаборатория Song Han (MIT), известного специалиста по эффективному глубокому обучению, опубликовала репозиторий со скиллом для AI-агентов, предназначенным для оптимизации кернеловi под архитектуры Hopperi и Blackwelli.

Скилл содержит набор скриптов, которые позволяют агенту самостоятельно обращаться к базам знаний, блогам, PR'ам и другим артефактам, посвящённым тензорным ядрам и архитектурным особенностям Hopper и Blackwell — то есть автоматизирует часть рутинной работы по низкоуровневой оптимизации GPU-кода.

Полный разбор →

AMD планирует повышение цен на GPU и память

P@prohitecавтор про «tech»
4 нед
AMD планирует повышение цен на GPU и память
Ещё ↓