← к ленте

FreeToken: новый движок для локального инференса MoE

т@techn0danyaAI-инженер
5 дн

Обзор FreeToken — движка для локального инференса MoE от создателей vLLM и SGLang, показывающего высокую скорость на потребительском железе.

Локальный запуск мощных ИИ-моделей становится доступнее на обычном домашнем железе.

  • FreeToken позволяет запускать крупные MoE-модели на видеокартах с 8 ГБ памяти.
  • Движок оптимизирует работу агентов, критически сокращая время ожидания ответа (TTFT).
  • Технология эффективно распределяет нагрузку между CPU и GPU, адаптируясь под пропускную способность шины конкретного ПК.
Ноутбучная 4060 и 35B на 39 токенов в секунду Знакомое чувство: листаешь ленту, очередной чувак крутит свежую модель на паре PRO 6000 стоимостью с машину, и думаешь — ну ладно, это явно не для нас. Вышла FreeToken, движок для локального инференса MoE. Делали те же люди, что vLLM и SGLang. Их цифра для ноутбучной RTX 4060 с 8 ГБ и урезанным вдвое линком PCIe x8: Qwen3.6-35B-A3B в NVFP4 → 39.3 tok/s Это 92% от скорости полноценной 4090 и выше медианной скорости декода Codex в проде. Но самое интересное там не про пропускную способность. Они померили то, что обычно не меряют вообще: реальные агентные сессии через OpenCode, Claude Code и OpenClaw, с настоящими вызовами инструментов и растущим контекстом. И вот что вылезло: худший TTFT за сессию: FreeToken — 44 с, llama.cpp — 232 с, KTransformers — 946 с У OpenClaw watchdog на 120 секунд. То есть движок формально работает, средний tok/s приличный, а агент до ответа просто не доживает. Однопромптовые бенчмарки про это молчат в принципе. Под капотом идея, которая нравится мне своей простотой. Передача эксперта по PCIe и его же вычисление на CPU тянут из одной и той же памяти хоста — значит, это вообще не выбор «или-или», а задача о дележе полосы: q* ≈ m · B_P / B_H Промахи кэша делятся ровно в отношении двух пропускных, померенных на твоей машине. Подставил их же числа: на 4060 по шине уходит 25% промахов, на десктопе с 5090 — уже 91%. Никакая фиксированная политика не может быть права одновременно в обоих случаях. Написал подробный разбор на Хабр Сам ещё не ставил. Достроил на бумаге недостающую точку для 16-гиговых карт — по их же формуле у 5080 должно выходить около 0.91, то есть почти всё уезжает по шине. Пойду проверю, заодно посмотрю, не свалится ли оно под виндой в CPU-фолбэк, там с пиннингом памяти всё непросто. Статья: arxiv.org/abs/2608.16157 Код: github.com/FlashML-org/FreeToken #AI @techn0danya
FreeToken: новый движок для локального инференса MoE

Кратко (AI)

Вышел движок FreeToken для локального инференса MoE-моделей, разработанный создателями vLLM и SGLang. Он демонстрирует высокую производительность на потребительских видеокартах, таких как RTX 4060, и значительно превосходит аналоги по времени первого токена (TTFT) в агентных сессиях.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖