← к ленте

Релиз китайской модели Kimi K3

т@techn0danyaAI-инженер
1 мес

Обзор характеристик новой китайской модели Kimi K3: архитектура, бенчмарки, стоимость API и особенности работы.

😋 Начнем со вкусного Ответ китайцев на Fable убил. И имя ему Kimi K3 На данный момент релизнули свежий претрейн на 2,8 триллиона параметров и первую открытую модель 3T-класса. По бенчам стабильно обходит Opus 4.8, но до Fable 5 и GPT 5.6 Sol всё же не дотягивает. Уже доступна в чате, API и кодинг-подписке. Веса обещают скинуть до 27 июля. Основные хайлаты архитектуры специально для вас: - Kimi Delta Attention (KDA) — новый механизм внимания, заточенный под длину: отсюда нативный контекст в 1M токенов и вменяемый прайс на инференс. - Attention Residuals (AttnRes) — замена классическим резидуалам: вместо того чтобы равномерно копить сигнал по глубине, модель выборочно подтягивает представления с нужных слоёв. - Stable LatentMoE — спарсити на максималках: из 896 экспертов активируются всего 16. Чтобы такое вообще обучалось, пришлось выкрутиться: Quantile Balancing распределяет экспертов по квантилям роутера без ручных костылей, а Per-Head Muon тюнит каждую голову внимания отдельно. Плюс активация SiTU, Gated MLA и quant-aware тренировка прямо со стадии SFT (веса в MXFP4, активации в MXFP8). В сумме — примерно 2,5x к эффективности скейлинга относительно K2. По деньгам: $3/$15 за миллион входных/выходных токенов — ровно прайс Sonnet. Кэширование автоматическое, на закэшированные токены −90% ($0.30), а хитрейт кэша в кодинг-нагрузках у них выше 90%. При этом K3 тратит меньше токенов на задачу, так что стоимость на таск выходит примерно в два раза ниже, чем у Opus 4.8. Из забавного: K3 уже оптимизировала кернелы собственной архитектуры, за 48 часов в автономе спроектировала чип под нано-модель себя же и сама смонтировала свой тизер. Нарциссизм, но продуктивный. Из не очень: модель чувствительна к истории мышления — не переключайтесь на неё посреди сессии от другой модели. И бывает излишне инициативной, так что границы лучше прописать в системном промпте. #AI @techn0danya

Кратко (AI)

Китайская компания представила модель Kimi K3 с 2,8 трлн параметров и нативным контекстом в 1 млн токенов. Модель использует архитектуру KDA и Stable LatentMoE, показывая высокую эффективность и конкурентную стоимость API. Разработчики отмечают высокую производительность, но предупреждают о чувствительности модели к смене контекста.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖