FreeToken: инференс MoE-моделей на потребительском железе
Н@GreenNeuralRobotsAI-инженер
1 недСистема для локального запуска MoE-моделей от 35B до 753B с динамическим распределением ресурсов между CPU и GPU.
Технология позволяет запускать огромные нейросети на обычном домашнем компьютере.
- Снижает порог входа для работы с мощными ИИ-моделями без аренды дорогих серверов.
- Динамическое управление памятью позволяет эффективно использовать имеющиеся ресурсы GPU и CPU.
- Поддержка агентных сценариев упрощает создание локальных ИИ-помощников.
FreeToken
Инференс-система для MoE-моделей на домашнем железе
- Запуск моделей локально от 35B на ноутбуке до 284B на игровом ПК и 753B GLM-5.2 на одной рабочей станции
- Без фиксированной схемы выгрузки: динамически распределяет вычисления между CPU и GPU под то, что реально свободно
- Поддержка агентных сценариев: переиспользование состояния между вызовами, адаптация под меняющийся паттерн нагрузки
- Оптимизация всего стека от раскладки модели на диске до runtime-управления памятью
- 20+ моделей, включая Qwen, DeepSeek, GLM, Mixtral и др. MoE-архитектур
- От 8 GB VRAM (ноутбук) до одной workstation GPU
- Открытый исходный код
- Авторы из FlashML при Berkeley — сплошь звёздные имена (Song Han, Matei Zaharia, Ion Stoica, Kurt Keutzer)
- Windows, Linux, macOS
Гитхаб
#lowvram #desktop #moe
VK | MAX

Кратко (AI)
Представлена система FreeToken для запуска крупных MoE-моделей на обычном оборудовании, от ноутбуков до рабочих станций. Она динамически распределяет нагрузку между CPU и GPU и поддерживает агентные сценарии работы. Проект разработан командой FlashML из Berkeley и доступен с открытым исходным кодом.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖