Анализ производительности моделей при исправлении багов
Перенос KV-кэша между разными LLM: независимая проверка идеи NVIDIA (Cache-2-Cache)
NVIDIA опубликовала статью о переносе KV-кэшiа между разными моделями: маленькая модель делает префилл (читает промпт), большая отвечает, используя её кэш через линейный маппинг — без повторного прогона промпта дорогой моделью. Идея развивает более раннюю концепцию Cache-2-Cache, где обучаемый fuser-модуль передавал в KV-кэш target-модели знания из source-модели; NVIDIA предложила упрощение — обучаемый (в большинстве случаев линейный) проектор, подбирающий наиболее полезные слои source-модели для target-модели.
У статьи NVIDIA не было ни кода, ни анонса — только цифры на 8x H100. Автор одного из телеграм-каналов решил проверить подход на практике: собрал реализацию внутри vLLM на паре Qwen3 0.6B и 1.7B на двух видеокартах 3090 и подтвердил, что метод действительно работает и даёт прирост скорости, хотя и меньший, чем заявляли авторы оригинальной статьи на топовом оборудовании.
ВыводНезависимая реализация: собственный KV-коннектор для vLLM, перенос кэша через /dev/shm, ridge-маппер с решением в замкнутой форме, обучение — 15 минут на датасете FineWeb
Метод отжига для борьбы с зацикливанием AI-агентов
Обзор трендов в разработке и ИИ: оптимизация, агенты и экономика моделей
Обзор инструментов и оптимизаций для Minimax H3
Релиз MiniMax-H3 Pruned Ref-Delta Fused
Оптимизация системных промптов через gisting: опыт Shopify
Prime Flash MoE: оптимизированные кернелы для архитектуры Blackwell
Компания Prime Intellect представила Prime Flash MoEi — специализированный fused-кернелi, предназначенный для ускорения работы моделей с архитектурой Mixture-of-Experts (MoE) на графических процессорах NVIDIA Blackwell.
Решение направлено на устранение узких мест при работе с памятью и синхронизацией потоков, что позволяет значительно повысить производительность вычислений по сравнению со стандартными методами PyTorch.
Отказ от сторонних библиотек в пользу stack flattening
Функция Compact OS в Windows 10/11 для экономии места

Turbovec — новая библиотека векторного поиска на основе алгоритма Google TurboQuant
Появилась независимая реализация алгоритма сжатия векторов TurboQuanti, описанного Google в статье, принятой на ICLR 2026, — библиотека Turbovec на Rust с привязками для Python. Она сжимает векторные данные примерно в 8 раз и, по заявлению автора, ищет быстрее популярной библиотеки FAISSi, что важно для всех, кто строит поиск по эмбеддингам на больших коллекциях документов.
К самому Google проект не имеет отношения — это чужая реализация опубликованного алгоритма, распространяемая по лицензии MIT.
Оптимизация поиска в гиперболических пространствах

DFlash 2: новый метод спекулятивного декодирования ускоряет LLM в разы
Вышло второе поколение DFlash — техники спекулятивного декодирования для ускорения инференса больших языковых моделей. Первое поколение DFlash уже стало отраслевым стандартом, набрав 3,5 млн загрузок на Hugging Face. Суть подхода: маленькая модель быстро предсказывает кусок текста, а большая проверяет его одним проходом вместо того, чтобы генерировать по слову — итоговый текст полностью идентичен оригиналу, но выдаётся быстрее.
На практике это уже проверили с моделью Qwen3.8-27B: на ноутбуке она выдаёт 70 токенов/с вместо обычных ~15–20, а ускорение достигает 2.7–4.6 раз в зависимости от модели и настроек.
Секреты оптимизации игры Inside от студии Playdead
Оптимизация лимитов Claude: советы по использованию моделей

Сравнение стоимости использования скафолдов для GPU-задач

Снижение мощности видеокарты для борьбы с перегревом
Обзор блога Simon Veitner по оптимизации GPU-кернелов
Создатель uv ускорил запуск Codex CLI в 25 раз после перехода в OpenAI
Чарли Марш, основатель и CEO компании Astral (разработчик Python-инструментов uvi, Ruff, ty), в марте перешёл в OpenAI вместе с покупкой Astral и теперь работает в подразделении Codex. В последнем релизе он переработал запуск командной строки Codex CLIi, сократив время холодного старта примерно в 25 раз.
Ранее запуск codex занимал заметное время из-за загрузки конфигов, аутентификации, установки соединений и подготовки окружения — теперь это происходит почти мгновенно. По отзывам, Codex CLI субъективно стартует даже быстрее Pi и Claude Code.
Scale AI представила бенчмарк HarnessOpt-Bench для оценки способностей моделей к оптимизации ИИ-агентов
