Команда опубликовала на архиве (arXiv) первый релиз своей разработки — метод спекулятивного декодинга для ускорения инференса языковых моделей. Заявлено ускорение в 4.37 раза по сравнению с обычным автогрессивным декодированием и превосходство над оптимизированным бейзлайном DFlashi на 24.7%.
Авторы называют результат state-of-the-art (SOTA), по крайней мере на модели Qwen3.6 — метод превосходит всё, что публично известно в этой области, включая DFlash. Тема значима для быстрого инференса на устройстве (on-device inference).
4.37-foldускорение декодирования
24.7%превосходство над DFlash
- Ускорение составляет 4.37x относительно автогрессивного (autoregressive) декодирования
- Превосходство над оптимизированным бейзлайном DFlash — 24.7%
- Метод протестирован и заявлен как SOTA на модели Qwen3.6
- Код и веса опубликованы на GitHub и Hugging Face (HF)
- Поддержка метода готовится к добавлению в собственный инференс-движок команды
Поддержка метода должна появиться в инференс-движке команды («скоро доедет»), что позволит применять его в продакшне.
Это произошло: Использование FP4 квантования в продакшене →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖