Если коротко - от K2 архитектура K3 отличается почти во всём.🟡Внимание В K2 все слои (61) работали на одном механизме, MLA. В K3 слоёв 93, и собраны они блоками - 3 слоя KDA и один глобальный MLA, суммарно 69 и 24. KDA сжимает предыдущий текст в состояние фиксированного размера, поэтому длина диалога перестаёт раздувать кэш. Явных позиционных меток в модели нет, и она растягивается до миллиона токенов без привычных приёмов вроде перенастройки RoPE. 🟡Residual connections Обычно слой получает всё накопленное предыдущими слоями одной суммой. Attention Residuals позволяют каждому слою выбирать, из каких ранних блоков брать информацию. 93 слоя K3 разбиты на 8 блоков по 12. 🟡MoE Маршрутизируемых экспертов теперь 896 против 384 у K2, на токен активируются 16 вместо 8, общих экспертов стало 2 вместо одного. Считают они во вдвое более узком латент спэйсе, чем основной, а результат возвращают в общий поток. Функцию активации SwiGLU заменили на SiTU-GLU, схему балансировки нагрузки - на Quantile Balancing. Общий профит Moonshot оценивает примерно в 2,5 раза по эффективности масштабирования. 🟡Агентские способности Тут сыграло роль не столько железо, сколько дообучение. 3 специализации (общие задачи, агенты, код) обучали отдельно, каждую на трёх уровнях ризонинга, а 9 получившихся моделей слили в одну. Отдельные тренировочные эпизоды доходят до тысяч вызовов инструментов, причём состояние файлов, приложений и виртуальных машин сохраняется между шагами. 🖥Github @ai_machinelearning_big_data #AI #ML #LLM #KimiK3 #MoonshotAI
Moonshot AI представила технический отчет по модели Kimi K3
M@ai_machinelearning_big_dataAI-инженер
1 месРазбор архитектурных изменений в новой модели Kimi K3 от Moonshot AI: отказ от RoPE, новая структура слоев KDA и улучшенная MoE.
Moonshot AI представила архитектурные инновации, позволяющие эффективнее обрабатывать длинные контексты и сложные агентские задачи.
- Внедрение KDA-блоков позволяет фиксировать размер кэша независимо от длины диалога.
- Отказ от RoPE упрощает масштабирование модели до миллиона токенов.
- Увеличение количества экспертов в MoE повышает вычислительную эффективность в 2.5 раза.
- Новый подход к обучению агентов позволяет модели стабильно выполнять тысячи вызовов инструментов.
📌 Moonshot AI опубликовала техотчёт Kimi K3

Кратко (AI)
Компания Moonshot AI опубликовала технический отчет о своей новой модели Kimi K3. Основные изменения включают переход на гибридную архитектуру слоев KDA и MLA, отказ от позиционных меток RoPE для работы с длинным контекстом и значительное расширение системы MoE с новыми функциями активации.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖