Проблемы train-inference mismatch в MoE моделях при RL
Prime Flash MoE: оптимизированные кернелы для архитектуры Blackwell
Компания Prime Intellect представила Prime Flash MoEi — специализированный fused-кернелi, предназначенный для ускорения работы моделей с архитектурой Mixture-of-Experts (MoE) на графических процессорах NVIDIA Blackwell.
Решение направлено на устранение узких мест при работе с памятью и синхронизацией потоков, что позволяет значительно повысить производительность вычислений по сравнению со стандартными методами PyTorch.
FreeToken: новая система для локального запуска MoE-моделей
Исследователи из FlashML (Berkeley) представили FreeToken — систему для эффективного локального инференсiа больших MoE-моделей (Mixture of Experts) на потребительском железе. Проект позволяет запускать модели от 35B до 753B параметров на устройствах от ноутбуков до рабочих станций.
Ключевое преимущество системы заключается в динамическом распределении вычислений между GPU, CPU и RAM без фиксированной схемы выгрузки. Это позволяет оптимизировать работу с памятью и пропускной способностью шины PCIe, обеспечивая высокую скорость генерации токенов и минимальное время до первого токена (TTFTi) в агентных сценариях.
Оптимизация инференса MoE моделей через Warp Decode от Cursor
Sand.ai представила открытую видеомодель MAGI-2 Preview
Запуск Kimi K3 на CPU с минимальным объемом RAM
Оптимизация локальных LLM: от квантования до стриминга с SSD
Оптимизация MoE-кернелов: переход от push- к pull-based dispatching
Mixture-of-Kittens: новый open-source MoE мегакернел для NVL72

WASTE: движок на 6000 строк C запускает полновесную Kimi K3 без GPU, подгружая экспертов с SSD
Разработчики SQLite AI создали инференс-движок WASTE (6000 строк C, без BLAS, CUDA и Python в рантайме), который позволяет запускать полновесную MoEi-модель Kimi K3 на обычном железе — вплотную к пределу возможностей потребительских дисков и памяти. Модель никогда полностью не загружается ни в RAM, ни в VRAM: в память кладётся только «плотный» резидентный блок, а нужные на каждом шаге эксперты подтягиваются прямо с диска.
Это важно, потому что Kimi K3 — гигантская MoE-модель (по разным оценкам 2,8–3 трлн параметров), которая в обычном виде требует терабайты памяти. WASTE показывает, что такие модели можно гонять локально без серверных стоек с DDR5, хотя цена — скорость в доли токена в секунду.
Первая статья о мержинге экспертных моделей
Впечатления от конференции ICML 2026
Феномен «моэ» и трансформация идентичности в виртуальной среде
Обзор трендов ICML 2026: RLVR, GRPO и оптимизация MoE
LingBot-Video: MoE-видеогенератор для робототехники
Tencent выпустила финальную версию MoE-модели Hy3
Компания Tencent перевела свою модель Hy3 из статуса preview в полноценный релиз. Это мощная MoEi-модель для рассуждений, работы с кодом и агентных задач, которая, по заявлению разработчиков, обгоняет модели в 2–5 раз крупнее себя по ключевым задачам.
Особенность релиза в том, что высокая эффективность достигнута без сложных архитектурных трюков — используется обычный GQAi, без sparse attention и MLA, что, по мнению аналитиков, оставляет запас для дальнейшей оптимизации.