freetokenСбросить фильтр ×

FreeToken: новая система для локального запуска MoE-моделей

Исследователи из FlashML (Berkeley) представили FreeToken — систему для эффективного локального инференсiа больших MoE-моделей (Mixture of Experts) на потребительском железе. Проект позволяет запускать модели от 35B до 753B параметров на устройствах от ноутбуков до рабочих станций.

Ключевое преимущество системы заключается в динамическом распределении вычислений между GPU, CPU и RAM без фиксированной схемы выгрузки. Это позволяет оптимизировать работу с памятью и пропускной способностью шины PCIe, обеспечивая высокую скорость генерации токенов и минимальное время до первого токена (TTFTi) в агентных сценариях.

39.3 tok/sскорость генерации Qwen3.6-35B на RTX 4060
44 свремя до первого токена в агентных сессиях
753Bмаксимальный размер модели (GLM-5.2)

Полный разбор →

Это всё на сейчас.