moeСбросить фильтр ×

Проблемы train-inference mismatch в MoE моделях при RL

A@AIexTimeAI-инженер
3 дн

Prime Flash MoE: оптимизированные кернелы для архитектуры Blackwell

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 3 дн назад

Компания Prime Intellect представила Prime Flash MoEi — специализированный fused-кернелi, предназначенный для ускорения работы моделей с архитектурой Mixture-of-Experts (MoE) на графических процессорах NVIDIA Blackwell.

Решение направлено на устранение узких мест при работе с памятью и синхронизацией потоков, что позволяет значительно повысить производительность вычислений по сравнению со стандартными методами PyTorch.

20%прирост скорости в формате bf16
2 разаускорение в формате mxfp8

Полный разбор →

FreeToken: новая система для локального запуска MoE-моделей

Исследователи из FlashML (Berkeley) представили FreeToken — систему для эффективного локального инференсiа больших MoE-моделей (Mixture of Experts) на потребительском железе. Проект позволяет запускать модели от 35B до 753B параметров на устройствах от ноутбуков до рабочих станций.

Ключевое преимущество системы заключается в динамическом распределении вычислений между GPU, CPU и RAM без фиксированной схемы выгрузки. Это позволяет оптимизировать работу с памятью и пропускной способностью шины PCIe, обеспечивая высокую скорость генерации токенов и минимальное время до первого токена (TTFTi) в агентных сценариях.

39.3 tok/sскорость генерации Qwen3.6-35B на RTX 4060
44 свремя до первого токена в агентных сессиях
753Bмаксимальный размер модели (GLM-5.2)

Полный разбор →

Оптимизация инференса MoE моделей через Warp Decode от Cursor

К@quant_prune_distillAI-инженер
1 нед

Sand.ai представила открытую видеомодель MAGI-2 Preview

э@ai_newzAI-инженер
1 нед

Запуск Kimi K3 на CPU с минимальным объемом RAM

1 нед

Оптимизация локальных LLM: от квантования до стриминга с SSD

К@quant_prune_distillAI-инженер
2 нед

Оптимизация MoE-кернелов: переход от push- к pull-based dispatching

К@quant_prune_distillAI-инженер
3 нед

Mixture-of-Kittens: новый open-source MoE мегакернел для NVL72

К@quant_prune_distillAI-инженер
3 нед
Mixture-of-Kittens: our open-source MoE megakernel for NVL72s 📄 Блогпост 💻 Код Ребята из курсора реализовали MXFP8 мегакернел под названием Mixture-of-Kittens, где пофьюжены все операции для слоя смеси экспертов, специализированный под GB300 NVL72s. В отличие от MegaMoE от команды Дипсика 🐋, этот кернел не только под инференс, а под обучение.
Mixture-of-Kittens: новый open-source MoE мегакернел для NVL72

WASTE: движок на 6000 строк C запускает полновесную Kimi K3 без GPU, подгружая экспертов с SSD

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 3 нед назад

Разработчики SQLite AI создали инференс-движок WASTE (6000 строк C, без BLAS, CUDA и Python в рантайме), который позволяет запускать полновесную MoEi-модель Kimi K3 на обычном железе — вплотную к пределу возможностей потребительских дисков и памяти. Модель никогда полностью не загружается ни в RAM, ни в VRAM: в память кладётся только «плотный» резидентный блок, а нужные на каждом шаге эксперты подтягиваются прямо с диска.

Это важно, потому что Kimi K3 — гигантская MoE-модель (по разным оценкам 2,8–3 трлн параметров), которая в обычном виде требует терабайты памяти. WASTE показывает, что такие модели можно гонять локально без серверных стоек с DDR5, хотя цена — скорость в доли токена в секунду.

982 ГиБразмер сконвертированной модели K3
0,49-0,54 токена/сскорость на MacBook с 64 ГБ
6000 строкобъём кода движка WASTE на C

Полный разбор →

Первая статья о мержинге экспертных моделей

L@lovedeathtransformersAI-инженер
1 мес
https://arxiv.org/pdf/2607.09375 По моему первая статья про мержинг "экспертных" моделей. Fan fact: Mistral все ещё не решил нормлаьно эту проблему

Впечатления от конференции ICML 2026

Д@stuffyNLPAI-инженер
1 мес

Феномен «моэ» и трансформация идентичности в виртуальной среде

@acceleratethefutureмедиа / агрегатор
1 мес

Обзор трендов ICML 2026: RLVR, GRPO и оптимизация MoE

Д@stuffyNLPAI-инженер
1 мес

LingBot-Video: MoE-видеогенератор для робототехники

Н@GreenNeuralRobotsAI-инженер
1 мес
LingBot-Video #MoE видеогенератор для воплощённого интеллекта (роботов). Объединяет синтез видео с пониманием физического мира t2v, i2v, ti2v • Создаёт видео в открытом мире, прогнозирует траектории движения • Моделирует роботов, гуманоидов, четвероногих и мобильные платформы • Воспроизводит свойства материалов, освещение и отражения • Имитирует реалистичные движения Есть две версии: компактная Dense (1.3B) и мощная MoE (30B-A3B) Лидирует в RBench Leaderboard по всем показателям Для чего роботам видеогенератор? Например для синтеза обучающих видео и тестирования роботов Гитхаб HF Демо Спасибо @m_franz #t2v #i2v #ti2v

Tencent выпустила финальную версию MoE-модели Hy3

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 1 мес назад

Компания Tencent перевела свою модель Hy3 из статуса preview в полноценный релиз. Это мощная MoEi-модель для рассуждений, работы с кодом и агентных задач, которая, по заявлению разработчиков, обгоняет модели в 2–5 раз крупнее себя по ключевым задачам.

Особенность релиза в том, что высокая эффективность достигнута без сложных архитектурных трюков — используется обычный GQAi, без sparse attention и MLA, что, по мнению аналитиков, оставляет запас для дальнейшей оптимизации.

295Bвсего параметров модели
21Bактивных параметров на токен
256Kмаксимальный контекст в токенах

Полный разбор →

Релиз open-source модели LongCat-2.0

1 мес
LongCat-2.0 открыли в open source. Это MoE-модель на 1,6T параметров с примерно 48B активных, заточенная под агентное программирование и длинный контекст до 1M токенов. По бенчмаркам: • 59,5 на SWE-bench Pro • 70,8 на Terminal-Bench 2.1 • 77,3 на SWE-bench Multilingual Внутри: sparse attention для длинного контекста, ScMoE для экономной активации экспертов и MOPD для разделения задач между агентными, reasoning и interaction-экспертами. Модель обучали с нуля на 35T+ токенов. Есть поддержка деплоя на GPU и NPU. 🤖https://modelscope.ai/collections/meituan-longcat/LongCat-20

Agents-A1: 35B MoE агент с кросс-доменной координацией

Н@GreenNeuralRobotsAI-инженер
1 мес
Agents-A1 35B #MoE агент, тянет уровень триллионника без раздувания параметров. Решает задачу кросс-доменной координации через дистилляцию. • масштабирует горизонт агента, а не параметры • контекст 256К • объединяет 6 разнородных доменов • использует 45K-токенные траектории • мультиучительская дистилляция Работает на компактной архитектуре, показывает топовые метрики в сложных средах. Гитхаб HF #agent

Релиз квантованной модели North-Mini-Code-1.0

Н@GreenNeuralRobotsAI-инженер
1 мес

Обзор обновлений Apple Intelligence и архитектуры моделей AFM

С@seeallochnayaAI-инженер
1 мес
Ещё ↓