Moonshot AI выпустили Kimi K3 в open source
A@ai_productAI-инженер
1 месMoonshot AI открыли исходный код модели Kimi K3 с 2.8T параметров, уникальной архитектурой без позиционного кодирования и высокой эффективностью обучения.
Появление мощной открытой модели с уникальными методами оптимизации ускоряет развитие ИИ-инструментов для всех разработчиков.
- Kimi K3 демонстрирует, что огромные модели могут быть эффективными при использовании новых методов квантования и управления ресурсами.
- Открытость архитектуры и методологии обучения позволяет другим лабораториям воспроизводить и улучшать передовые результаты.
- Модель показала способность к автономному проектированию чипов и поиску критических уязвимостей, что расширяет границы применения ИИ в инженерии.
Kimi K3 таки выложили в опенсорc
https://huggingface.co/moonshotai/Kimi-K3
И опубликовали отчет.
В общем, ничего супер-нового, но несколько интересных вещей отметил:
– 2.8T параметров всего, но на каждый токен работает 104B – 16 экспертов из 896.
– Контекст 1M, а позиционного кодирования нет вообще. Поэтому огромный контекст для нее вообще детский лепет и памяти на него не надо вагонами завозить.
– MXFP4-квантизацию вводят не после обучения, а прямо во время RL. Модель с самого начала учится жить сжатой, то есть серверную стойку можно взять и поменьше :)
– Стараются экономно расходовать токены, в том числе в мультимодальности. На BrowseComp лучший результат в мире за $2.03 за задачу. GPT-5.6 Sol вдвое дороже, Клод на максимуме – на порядок
Еще из прикольного:
– За обучение создали 51 миллион виртуалок-песочниц. Пока модель думает, песочница на паузе и не ест ресурсы вообще – а думает она до 98% времени жизни задачи. Вот на этом простое и сэкономили кучу денег на обучение.
– За один 48-часовой автономный прогон K3 спроектировала и проверила прототип чипа для ИИ, вообще с нуля. 4 мм², 8700 токенов/с в RTL-симуляции. Исходники выложили на гитхаб
– Написала свой компилятор для ИИ, обгоняет torch.compile
– Воспроизвела результат из астрофизики за два часа вместо двух недель: 20+ статей, 300 уравнений состояния, нашла ошибки в опубликованных формулах
– Смонтировала видео-ролик про собственную архитектуру из 56 клипов
Отдельно про кибербез. Мерились с GLM-5.2. Нашли 16 ранее неизвестных уязвимостей, две в ядре Linux. UK AISI и NIST проверяли независимо: GLM обходит, до фронтира не дотягивает – 0 из 41 на end-to-end эксплойтах. То есть по кибербезопасности модель лучшая из опенсорса.
По бенчмаркам всё то же, что и неделю назад: первое место на WebDev Arena среди 99 моделей (впервые открытая модель возглавила лидерборд живых людей). Про дизайн там читал до этого статью интересную, как топовые модели сейчас стараются в болеее лучший дизайн.
Ну и здорово, что поделились вообще всем, как что работает, как дообучали, как песочницы делали, какие библиотеки использовали. То есть повторить и улучшить сможет любая лаборатория. Вау!
Но у себя дома стойку под 2.8T, правда, всё ещё надо иметь :)
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
Кратко (AI)
Компания Moonshot AI выложила в открытый доступ модель Kimi K3 с 2.8T параметров. Модель использует архитектуру без позиционного кодирования, квантование MXFP4 во время обучения и инновационную систему виртуальных песочниц, что позволяет ей эффективно решать сложные задачи, включая проектирование чипов и поиск уязвимостей в ядре Linux.
Обсуждение
2MXFP4 прямо в RL это дельная штука, потом не надо квантовать готовую модель и молиться чтобы качество не просело. А чип за 48 часов автономного прогона вообще отдельная тема, похоже потихоньку начинается то самое - модели проектируют железо под себя.
MXFP4 сразу в RL логично, чтобы не жечь ресурсы впустую, тут не поспоришь. А чип за 48 часов в RTL-симуляции - это ещё не железо, просто быстрый прототип на бумаге, до реального чипа там далеко.