optimizaciiaСбросить фильтр ×

Выпуск LoRA-адаптеров для ускорения MiniMax-H3

Н@GreenNeuralRobotsAI-инженер
вчера
MiniMax-H3-Acc-LoRAs LoRA ускорения для MiniMax-H3 от Alibaba PAI Параллельная дистилляция декодирования (PDD). Видео и аудио за 8 шагов вместо обычных 20 - Две версии: FL2VA (от первого кадра) и Ref2VA (по референсам) HF ComfyUI Спасибо @m_franz #optimization #minimaxH3 #lora VK | MAX

Анализ производительности моделей при исправлении багов

T@extremecodeAI-инженер
вчера
Сидел тут выборочно осматривал на чем конкретно определенные модели факапились. Решил поисправлять за ними тупые баги, что б узнать как конечная имплементация пашет. Ну просто поразительный перформанс листа, особенно когда тебе ниче не нужно рендерить 😄

Перенос KV-кэша между разными LLM: независимая проверка идеи NVIDIA (Cache-2-Cache)

NVIDIA опубликовала статью о переносе KV-кэшiа между разными моделями: маленькая модель делает префилл (читает промпт), большая отвечает, используя её кэш через линейный маппинг — без повторного прогона промпта дорогой моделью. Идея развивает более раннюю концепцию Cache-2-Cache, где обучаемый fuser-модуль передавал в KV-кэш target-модели знания из source-модели; NVIDIA предложила упрощение — обучаемый (в большинстве случаев линейный) проектор, подбирающий наиболее полезные слои source-модели для target-модели.

У статьи NVIDIA не было ни кода, ни анонса — только цифры на 8x H100. Автор одного из телеграм-каналов решил проверить подход на практике: собрал реализацию внутри vLLM на паре Qwen3 0.6B и 1.7B на двух видеокартах 3090 и подтвердил, что метод действительно работает и даёт прирост скорости, хотя и меньший, чем заявляли авторы оригинальной статьи на топовом оборудовании.

ВыводНезависимая реализация: собственный KV-коннектор для vLLM, перенос кэша через /dev/shm, ridge-маппер с решением в замкнутой форме, обучение — 15 минут на датасете FineWeb

x2.22ускорение TTFT в независимом тесте
17-25xзаявленное NVIDIA ускорение на 14B/32B с NVLink
94%сохранённое качество по HellaSwag

Полный разбор →

Метод отжига для борьбы с зацикливанием AI-агентов

D@dealerAIAI-инженер
2 дн

Обзор трендов в разработке и ИИ: оптимизация, агенты и экономика моделей

И@AImademydayAI-инженер
2 дн

Обзор инструментов и оптимизаций для Minimax H3

Н@GreenNeuralRobotsAI-инженер
2 дн

Релиз MiniMax-H3 Pruned Ref-Delta Fused

Н@GreenNeuralRobotsAI-инженер
2 дн
MiniMax-H3 Pruned Ref-Delta Fused r1024 Облегченная версия #MiniMaxH3, два отдельных чекпоинта склеены в один и сжаты Обычный H3 существует в двух вариантах: FL2VA и Ref2VA. ~33B параметров Здесь взяли обрезанную (pruned) версию FL2VA, вычислили разницу между Ref2VA и FL2VA, сжали эту разницу до аккуратного приближения (ранг 1024) и вшили прямо в веса. Получился один файл на ~20B параметров, который умеет и FL2VA, и Ref2VA без переключения чекпоинтов. + недавний апдейт - INT8 - еще компактнее версия для #ComfyUI Там есть #INT8 и INT8 #ConvRot #optimization VK | MAX

Оптимизация системных промптов через gisting: опыт Shopify

В@cryptovaleriiAI-инженер
2 дн

Prime Flash MoE: оптимизированные кернелы для архитектуры Blackwell

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 3 дн назад

Компания Prime Intellect представила Prime Flash MoEi — специализированный fused-кернелi, предназначенный для ускорения работы моделей с архитектурой Mixture-of-Experts (MoE) на графических процессорах NVIDIA Blackwell.

Решение направлено на устранение узких мест при работе с памятью и синхронизацией потоков, что позволяет значительно повысить производительность вычислений по сравнению со стандартными методами PyTorch.

20%прирост скорости в формате bf16
2 разаускорение в формате mxfp8

Полный разбор →

Отказ от сторонних библиотек в пользу stack flattening

L@llm_under_hoodAI-инженер
3 дн

Функция Compact OS в Windows 10/11 для экономии места

Х@habr_comмедиа / агрегатор
3 дн
Функция Compact OS в Windows 10/11 для экономии места

Turbovec — новая библиотека векторного поиска на основе алгоритма Google TurboQuant

Появилась независимая реализация алгоритма сжатия векторов TurboQuanti, описанного Google в статье, принятой на ICLR 2026, — библиотека Turbovec на Rust с привязками для Python. Она сжимает векторные данные примерно в 8 раз и, по заявлению автора, ищет быстрее популярной библиотеки FAISSi, что важно для всех, кто строит поиск по эмбеддингам на больших коллекциях документов.

К самому Google проект не имеет отношения — это чужая реализация опубликованного алгоритма, распространяемая по лицензии MIT.

~8xстепень сжатия векторов
31 ГБ → 4 ГБразмер коллекции из 10 млн документов
3,4–3,5 разаприрост скорости поиска над FAISS при 4-бит сжатии

Полный разбор →

Оптимизация поиска в гиперболических пространствах

T@kryak_startupAI-инженер
4 дн
Оптимизация поиска в гиперболических пространствах

DFlash 2: новый метод спекулятивного декодирования ускоряет LLM в разы

Вышло второе поколение DFlash — техники спекулятивного декодирования для ускорения инференса больших языковых моделей. Первое поколение DFlash уже стало отраслевым стандартом, набрав 3,5 млн загрузок на Hugging Face. Суть подхода: маленькая модель быстро предсказывает кусок текста, а большая проверяет его одним проходом вместо того, чтобы генерировать по слову — итоговый текст полностью идентичен оригиналу, но выдаётся быстрее.

На практике это уже проверили с моделью Qwen3.8-27B: на ноутбуке она выдаёт 70 токенов/с вместо обычных ~15–20, а ускорение достигает 2.7–4.6 раз в зависимости от модели и настроек.

3.5 млнзагрузок DFlash 1 на Hugging Face
70 токенов/сскорость Qwen3.8-27B на ноутбуке с DFlash 2
2.7–4.6 разадиапазон ускорения инференса

Полный разбор →

Секреты оптимизации игры Inside от студии Playdead

Р@progamedevгеймдев
4 дн
Программисты из Playdead рассказывают о секретах оптимизации Inside. Кстати, одна из причин почему Инсайд так круто ощущается — это как раз вот такая техническая магия. Никаких подвисаний и подлагиваний. https://www.youtube.com/watch?v=mQ2KTRn4BMI

Оптимизация лимитов Claude: советы по использованию моделей

В@ventureStuffмедиа / агрегатор
4 дн
Оптимизация лимитов Claude: советы по использованию моделей

Сравнение стоимости использования скафолдов для GPU-задач

Б@boris_againAI-инженер
5 дн
я ненавижу скафолды от модельных лаб. Опуская вопрос что они убогие, так они еще и закрытые, так еще и едят кредиты как фантики(ладно очевидно это фича). В связи с преждевременной кончиной лимитов я решил померить сколько каждый из скафолдов кушает на разных моделях: - Sol 5.6 medium - Kimi k3 high Собственно идея такая: есть задачка написать 3 body проблем для GPU и покрутить на gpu численную симуляцию, все модели справились НО pi agent стоит в 4! раза дешевле чем все соседи смотреть pr cмотреть логи
Сравнение стоимости использования скафолдов для GPU-задач

Снижение мощности видеокарты для борьбы с перегревом

Г@gmorevaAI-инженер
5 дн
Снижение мощности видеокарты с целью ее сохранения Видеокарты с нейронками работают очень активно и очень горячо. Иногда у меня 3090 разогревается до 85+ градусов, что уже губительно для нее. Разобрался как можно снизить максимальную мощность видеокарты, чтобы нагрева было меньше => температура теперь не поднимается выше 72 градусов и скорость работы почти не упала. Снял ролик про этот способ решения проблемы перегрева. Ссылки на видео на всех площадках: 📹 YouTube | VK | Rutube | Dzen 📹

Обзор блога Simon Veitner по оптимизации GPU-кернелов

К@quant_prune_distillAI-инженер
6 дн
Наткнулся на интересный блог от некоего Simon Veitner. Дизайн суровый, минималистичный, максимально дешево и сердито, но есть немало интересных статей про написание и ускорение кернелов, компоненты современных GPU, а также реализации различных алгоритмов в CuTe / CuTeDSL . В частности: • Making RMSNorm really fastMaking matrix transpose really fast on Hopper GPUsCuTeDSL on Hopper - WGMMA and TMA intro Будет полезно интересующимся написанием кернелов и эффективными программными реализациями алгоритмов на видеокартах, в особенности, на архитектурах Hopper и Blackwell.

Создатель uv ускорил запуск Codex CLI в 25 раз после перехода в OpenAI

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 6 дн назад

Чарли Марш, основатель и CEO компании Astral (разработчик Python-инструментов uvi, Ruff, ty), в марте перешёл в OpenAI вместе с покупкой Astral и теперь работает в подразделении Codex. В последнем релизе он переработал запуск командной строки Codex CLIi, сократив время холодного старта примерно в 25 раз.

Ранее запуск codex занимал заметное время из-за загрузки конфигов, аутентификации, установки соединений и подготовки окружения — теперь это происходит почти мгновенно. По отзывам, Codex CLI субъективно стартует даже быстрее Pi и Claude Code.

25 разускорение холодного старта Codex CLI

Полный разбор →

Scale AI представила бенчмарк HarnessOpt-Bench для оценки способностей моделей к оптимизации ИИ-агентов

1 нед
Scale AI представила бенчмарк HarnessOpt-Bench для оценки способностей моделей к оптимизации ИИ-агентов

Почему зарплаты руководителей маркетинга не падают при сокращении штата

М@fire_hireкарьера / HR
1 нед
Ещё ↓