Релиз китайской модели Kimi K3
т@techn0danyaAI-инженер
1 месОбзор характеристик новой китайской модели Kimi K3: архитектура, бенчмарки, стоимость API и особенности работы.
😋 Начнем со вкусного
Ответ китайцев на Fable убил. И имя ему Kimi K3
На данный момент релизнули свежий претрейн на 2,8 триллиона параметров и первую открытую модель 3T-класса. По бенчам стабильно обходит Opus 4.8, но до Fable 5 и GPT 5.6 Sol всё же не дотягивает. Уже доступна в чате, API и кодинг-подписке. Веса обещают скинуть до 27 июля.
Основные хайлаты архитектуры специально для вас:
- Kimi Delta Attention (KDA) — новый механизм внимания, заточенный под длину: отсюда нативный контекст в 1M токенов и вменяемый прайс на инференс.
- Attention Residuals (AttnRes) — замена классическим резидуалам: вместо того чтобы равномерно копить сигнал по глубине, модель выборочно подтягивает представления с нужных слоёв.
- Stable LatentMoE — спарсити на максималках: из 896 экспертов активируются всего 16. Чтобы такое вообще обучалось, пришлось выкрутиться: Quantile Balancing распределяет экспертов по квантилям роутера без ручных костылей, а Per-Head Muon тюнит каждую голову внимания отдельно.
Плюс активация SiTU, Gated MLA и quant-aware тренировка прямо со стадии SFT (веса в MXFP4, активации в MXFP8). В сумме — примерно 2,5x к эффективности скейлинга относительно K2.
По деньгам: $3/$15 за миллион входных/выходных токенов — ровно прайс Sonnet. Кэширование автоматическое, на закэшированные токены −90% ($0.30), а хитрейт кэша в кодинг-нагрузках у них выше 90%. При этом K3 тратит меньше токенов на задачу, так что стоимость на таск выходит примерно в два раза ниже, чем у Opus 4.8.
Из забавного: K3 уже оптимизировала кернелы собственной архитектуры, за 48 часов в автономе спроектировала чип под нано-модель себя же и сама смонтировала свой тизер. Нарциссизм, но продуктивный.
Из не очень: модель чувствительна к истории мышления — не переключайтесь на неё посреди сессии от другой модели. И бывает излишне инициативной, так что границы лучше прописать в системном промпте.
#AI
@techn0danya
Кратко (AI)
Китайская компания представила модель Kimi K3 с 2,8 трлн параметров и нативным контекстом в 1 млн токенов. Модель использует архитектуру KDA и Stable LatentMoE, показывая высокую эффективность и конкурентную стоимость API. Разработчики отмечают высокую производительность, но предупреждают о чувствительности модели к смене контекста.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖