q* ≈ m · B_P / B_H
Промахи кэша делятся ровно в отношении двух пропускных, померенных на твоей машине. Подставил их же числа: на 4060 по шине уходит 25% промахов, на десктопе с 5090 — уже 91%. Никакая фиксированная политика не может быть права одновременно в обоих случаях.
Написал подробный разбор на Хабр
Сам ещё не ставил. Достроил на бумаге недостающую точку для 16-гиговых карт — по их же формуле у 5080 должно выходить около 0.91, то есть почти всё уезжает по шине. Пойду проверю, заодно посмотрю, не свалится ли оно под виндой в CPU-фолбэк, там с пиннингом памяти всё непросто.
Статья: arxiv.org/abs/2608.16157
Код: github.com/FlashML-org/FreeToken
#AI
@techn0danyaFreeToken: новый движок для локального инференса MoE
т@techn0danyaAI-инженер
5 днОбзор FreeToken — движка для локального инференса MoE от создателей vLLM и SGLang, показывающего высокую скорость на потребительском железе.
Локальный запуск мощных ИИ-моделей становится доступнее на обычном домашнем железе.
- FreeToken позволяет запускать крупные MoE-модели на видеокартах с 8 ГБ памяти.
- Движок оптимизирует работу агентов, критически сокращая время ожидания ответа (TTFT).
- Технология эффективно распределяет нагрузку между CPU и GPU, адаптируясь под пропускную способность шины конкретного ПК.
Ноутбучная 4060 и 35B на 39 токенов в секунду
Знакомое чувство: листаешь ленту, очередной чувак крутит свежую модель на паре PRO 6000 стоимостью с машину, и думаешь — ну ладно, это явно не для нас.
Вышла FreeToken, движок для локального инференса MoE.
Делали те же люди, что vLLM и SGLang. Их цифра для ноутбучной RTX 4060 с 8 ГБ и урезанным вдвое линком PCIe x8:
Qwen3.6-35B-A3B в NVFP4 → 39.3 tok/s
Это 92% от скорости полноценной 4090 и выше медианной скорости декода Codex в проде.
Но самое интересное там не про пропускную способность. Они померили то, что обычно не меряют вообще: реальные агентные сессии через OpenCode, Claude Code и OpenClaw, с настоящими вызовами инструментов и растущим контекстом. И вот что вылезло:
худший TTFT за сессию: FreeToken — 44 с, llama.cpp — 232 с, KTransformers — 946 с
У OpenClaw watchdog на 120 секунд. То есть движок формально работает, средний tok/s приличный, а агент до ответа просто не доживает. Однопромптовые бенчмарки про это молчат в принципе.
Под капотом идея, которая нравится мне своей простотой. Передача эксперта по PCIe и его же вычисление на CPU тянут из одной и той же памяти хоста — значит, это вообще не выбор «или-или», а задача о дележе полосы:

Кратко (AI)
Вышел движок FreeToken для локального инференса MoE-моделей, разработанный создателями vLLM и SGLang. Он демонстрирует высокую производительность на потребительских видеокартах, таких как RTX 4060, и значительно превосходит аналоги по времени первого токена (TTFT) в агентных сессиях.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖