Китайская компания Moonshot AI выпустила Kimi K3 — MoEi-модель с 2,8 трлн общих и 104 млрд активных параметров, открытыми и бесплатно скачиваемыми весами, native vision и контекстом в 1M токенов. По заявлению авторов, это первая открытая модель 3T-класса, и по многим тестам она приблизилась к топовым закрытым американским моделям, вызвав ажиотаж в индустрии — вплоть до реакции Илона Маска, который назвал релиз «впечатляющим» и сообщил, что xAI готовит ответ на 2 трлн параметров.
Однако «бесплатность» весов не означает дешевизну использования: по официальным рекомендациям Moonshot AI для развёртывания К3 нужна конфигурация «суперузла» из 64+ ускорительных карт, с первоначальными инвестициями порядка 20 млн юаней (~$3 млн), не считая затрат на электроэнергию — что резко ограничивает круг тех, кто реально может запустить модель у себя.
- Архитектура строится вокруг масштабирования 'information flow' по трём осям: по длине последовательности — гибридное внимание (три слоя Kimi Delta Attentioni с delta rule и channel-wise forget gates на один слой глобального Gated MLA), позиционное кодирование отсутствует вообще (NoPEi), что позволяет расширение до 1M токенов без RoPE-хаков
- По глубине применяются Attention Residuals: каждый слой формирует learned pseudo-query и через softmax выбирает, что читать из выходов предыдущих слоёв, вместо единого накопленного residual stream
- По ширине — Stable LatentMoE: 896 экспертов, 16 активных на токен, роутинг в латентном пространстве вдвое меньшей размерности; стабильность держится на RMSNorm, ограниченной активации SiTU-GLU и Quantile Balancing; в сумме заявлено ~2.5x scaling efficiency относительно предыдущей модели K2
- Post-training включает SFT, затем обучение 9 экспертных политик (3 домена × 3 уровня reasoning effort) в agentic-окружениях, слитых в одну модель через Multi-Teacher On-Policy Distillation (студент генерирует собственные rollouts и получает per-token reward от подходящего учителя); quantization-aware training с весами экспертов в MXFP4 идёт уже с этапа SFT
- По оценке источника 1, модель уступает Claude Fable 5 и GPT-5.6 Sol на research-level reasoning и knowledge-work лидербордах
- Разбор экономики релиза принадлежит Дэн Синьсинь ( ), сооснователю Dedao и куратору AI Learning Circle, который сравнил бесплатный рецепт К3 с рецептом ресторана на три звезды Мишлен: сам рецепт бесплатен, но воспроизвести его нужно на 64 профессиональных 'плитах'-ускорителях с промышленным электропитанием и системой охлаждения
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖