← к ленте

Запуск MoE-модели Kimi k3 на 8 ГБ оперативной памяти

т@techn0danyaAI-инженер
3 нед

Разбор эксперимента по запуску огромной MoE-модели Kimi k3 на потребительском железе с использованием оптимизаций на языке C.

Этот эксперимент показывает пределы оптимизации нейросетей на обычном домашнем оборудовании.

  • Демонстрирует, что даже гигантские модели можно запустить на слабом железе при экстремальной оптимизации.
  • Подчеркивает критическую зависимость скорости работы LLM от объема доступной оперативной памяти.
  • Показывает эффективность использования языка C для низкоуровневой работы с весами моделей в обход тяжелых фреймворков.
🍝 Пакистанцы улучшают азиатов Сегодня понюхаем как Kimi K3 ужали в 8гб памяти и что из этого получилось. Для справки: обычно LLM требует RAM/VRAM по формуле: кол-во параметров × битность. Для 2,8T модели это терабайты памяти. Но Kimi k3 — это MoE-модель (Mixture of Experts), а это значит, что знания по сути распилены на более маленькие нейронки внутри (так называемые эксперты) Базово у кими их аж 896 (93% веса модели, а это около 1,5 ТБ), но можно оставить их меньше. В этой ситуации их будет всего 16. Стоит сразу оговориться, что всегда должны грузиться в память основные слои (так называемый Dense Trunk), так что оперативка достается не только экспертам. Чтобы ужаться до 8 гб оперативки очевидно по большей части все эксперты лежат на жестком диске, так что скорость даже на 16 (что очевидно мало) всего 33 секунд на один токен. Это значит, что одно предложение модель будет писать минут десять. Если выделить больше памяти под кэш (аж для 128 ГБ специально для богатых), то скорость вырастет до 20 секунд на токен. Из элегантного: все написано только на С без этих ваших модных PyTorch. Понятное дело, что пользоваться этим невозможно. Но как манифест, письмо любви локальным моделям или крутая строчка в резюме — очень даже. Репозиторий с полным описанием для самых любопытных оставил тут. #AI @techn0danya
Запуск MoE-модели Kimi k3 на 8 ГБ оперативной памяти

Кратко (AI)

Автор анализирует технический эксперимент по запуску MoE-модели Kimi k3 на 8 ГБ оперативной памяти. Благодаря использованию языка C и ограничению количества активных экспертов до 16, модель удалось запустить, однако скорость генерации остается крайне низкой (до 33 секунд на токен).

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖