Разработчики SQLite AI создали инференс-движок WASTE (6000 строк C, без BLAS, CUDA и Python в рантайме), который позволяет запускать полновесную MoEi-модель Kimi K3 на обычном железе — вплотную к пределу возможностей потребительских дисков и памяти. Модель никогда полностью не загружается ни в RAM, ни в VRAM: в память кладётся только «плотный» резидентный блок, а нужные на каждом шаге эксперты подтягиваются прямо с диска.
Это важно, потому что Kimi K3 — гигантская MoE-модель (по разным оценкам 2,8–3 трлн параметров), которая в обычном виде требует терабайты памяти. WASTE показывает, что такие модели можно гонять локально без серверных стоек с DDR5, хотя цена — скорость в доли токена в секунду.
982 ГиБразмер сконвертированной модели K3
0,49-0,54 токена/сскорость на MacBook с 64 ГБ
6000 строкобъём кода движка WASTE на C
- После конвертации из safetensorsi в собственный формат движка модель занимает 982 ГиБ (≈1,05 ТБ на диске)
- На MacBook Pro с 64 ГБ памяти в RAM резидентно держится только 27,28 ГБ, скорость генерации — 0,49–0,54 токена в секунду, без дистилляции и обрезки слоёв
- На каждый токен активируется около 4% весов модели — 16 экспертов в каждом из 92 слоёв (по данным Machinelearning); всего в модели 896 экспертов, что составляет 93% веса (~1,5 ТБ), и их можно ограничивать до 16 (по данным техноданя)
- На один токен движок вычитывает 17 ГБ данных: внутренний NVMe MacBook (12,78 ГБ/с) успевает за это время, внешний бокс по USB (0,94 ГБ/с) — считает тот же токен 13 секунд
- Раздувать кэш экспертов бесполезно: свыше 46 ГБ скорость падает — на 52 ГБ втрое, на 58 ГБ в 8 раз, так как macOS начинает вытеснять кэш на диск (подкачка)
- При урезании до 8 ГБ памяти (по данным техноданя) скорость падает до 33 секунд на токен; если выделить под кэш 128 ГБ, скорость улучшается до 20 секунд на токен
- Обязательно грузится в память «Dense Trunki» — плотные базовые слои модели, независимо от того, сколько памяти выделено под экспертов
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖