Вышло второе поколение DFlash — техники спекулятивного декодирования для ускорения инференса больших языковых моделей. Первое поколение DFlash уже стало отраслевым стандартом, набрав 3,5 млн загрузок на Hugging Face. Суть подхода: маленькая модель быстро предсказывает кусок текста, а большая проверяет его одним проходом вместо того, чтобы генерировать по слову — итоговый текст полностью идентичен оригиналу, но выдаётся быстрее.
На практике это уже проверили с моделью Qwen3.8-27B: на ноутбуке она выдаёт 70 токенов/с вместо обычных ~15–20, а ускорение достигает 2.7–4.6 раз в зависимости от модели и настроек.
3.5 млнзагрузок DFlash 1 на Hugging Face
70 токенов/сскорость Qwen3.8-27B на ноутбуке с DFlash 2
2.7–4.6 разадиапазон ускорения инференса
- DFlash 1 стал отраслевым стандартом спекулятивного декодирования с 3,5 млн загрузок на Hugging Face
- Обычное ускорение от DFlash 2 — 2.7–3.4 раза, в отдельных случаях до 4.6 раз
- Для практического использования драфтерi берётся не из самого чекпоинта модели, а отдельно — Qwen3.8-27B-DFlash2-GGUF
- Для запуска нужно собрать специальную версию llama.cppi из ветки pull-запроса #27342 (git fetch origin pull/27342/head:pr-27342), с поддержкой CUDA (GGML_CUDA=ON) или Apple Silicon (GGML_METAL=ON)
- На собранной сборке достигнута скорость 36.77 t/s при контексте 100535 токенов и 52.15 t/s при контексте 95k
- Запуск через llama-server с параметрами: модель Qwen3.8-27B-UD-Q3_K_XL.gguf, драфтер Qwen3.8-27B-DFlash2-Q4_K_M.gguf, --spec-type draft-dflash, --spec-draft-n-max 3, контекст 95536 токенов
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖