← к умной ленте

FreeToken: новая система для локального запуска MoE-моделей

Исследователи из FlashML (Berkeley) представили FreeToken — систему для эффективного локального инференсiа больших MoE-моделей (Mixture of Experts) на потребительском железе. Проект позволяет запускать модели от 35B до 753B параметров на устройствах от ноутбуков до рабочих станций.

Ключевое преимущество системы заключается в динамическом распределении вычислений между GPU, CPU и RAM без фиксированной схемы выгрузки. Это позволяет оптимизировать работу с памятью и пропускной способностью шины PCIe, обеспечивая высокую скорость генерации токенов и минимальное время до первого токена (TTFTi) в агентных сценариях.

39.3 tok/sскорость генерации Qwen3.6-35B на RTX 4060
44 свремя до первого токена в агентных сессиях
753Bмаксимальный размер модели (GLM-5.2)
  • Разработчики — команда FlashML из Berkeley, известная созданием vLLM и SGLang (Song Han, Matei Zaharia, Ion Stoica, Kurt Keutzer).
  • Система поддерживает более 20 архитектур, включая Qwen, DeepSeek, GLM и Mixtral.
  • На ноутбуке с RTX 4060 (8 GB VRAM) модель Qwen3.6-35B-A3B достигает скорости 39.3 токенов/с.
  • На RTX 5090 модель DeepSeek-V4-Flash (284B) выдает 22–25 токенов/с.
  • В агентных сценариях FreeToken показал TTFT 44 с, значительно опередив llama.cpp (232 с) и KTransformers (946 с).
  • Система работает на Windows, Linux и macOS, исходный код опубликован на GitHub.
Что дальше

Ожидается дальнейшее тестирование системы на картах с разным объемом памяти (например, 16 GB) для проверки эффективности распределения нагрузки по шине PCIe и стабильности работы под Windows.

Это произошло: Детализацию от Z-Image пересадили в видео-модели MiniMax-H3 и Joy-LTX 2.5 →

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖