Исследователи из FlashML (Berkeley) представили FreeToken — систему для эффективного локального инференсiа больших MoE-моделей (Mixture of Experts) на потребительском железе. Проект позволяет запускать модели от 35B до 753B параметров на устройствах от ноутбуков до рабочих станций.
Ключевое преимущество системы заключается в динамическом распределении вычислений между GPU, CPU и RAM без фиксированной схемы выгрузки. Это позволяет оптимизировать работу с памятью и пропускной способностью шины PCIe, обеспечивая высокую скорость генерации токенов и минимальное время до первого токена (TTFTi) в агентных сценариях.
- Разработчики — команда FlashML из Berkeley, известная созданием vLLM и SGLang (Song Han, Matei Zaharia, Ion Stoica, Kurt Keutzer).
- Система поддерживает более 20 архитектур, включая Qwen, DeepSeek, GLM и Mixtral.
- На ноутбуке с RTX 4060 (8 GB VRAM) модель Qwen3.6-35B-A3B достигает скорости 39.3 токенов/с.
- На RTX 5090 модель DeepSeek-V4-Flash (284B) выдает 22–25 токенов/с.
- В агентных сценариях FreeToken показал TTFT 44 с, значительно опередив llama.cpp (232 с) и KTransformers (946 с).
- Система работает на Windows, Linux и macOS, исходный код опубликован на GitHub.
Ожидается дальнейшее тестирование системы на картах с разным объемом памяти (например, 16 GB) для проверки эффективности распределения нагрузки по шине PCIe и стабильности работы под Windows.
Это произошло: Детализацию от Z-Image пересадили в видео-модели MiniMax-H3 и Joy-LTX 2.5 →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖