← к умной ленте

Новый метод спекулятивного декодинга обгоняет DFlash на 24.7%

Команда опубликовала на архиве (arXiv) первый релиз своей разработки — метод спекулятивного декодинга для ускорения инференса языковых моделей. Заявлено ускорение в 4.37 раза по сравнению с обычным автогрессивным декодированием и превосходство над оптимизированным бейзлайном DFlashi на 24.7%.

Авторы называют результат state-of-the-art (SOTA), по крайней мере на модели Qwen3.6 — метод превосходит всё, что публично известно в этой области, включая DFlash. Тема значима для быстрого инференса на устройстве (on-device inference).

4.37-foldускорение декодирования
24.7%превосходство над DFlash
  • Ускорение составляет 4.37x относительно автогрессивного (autoregressive) декодирования
  • Превосходство над оптимизированным бейзлайном DFlash — 24.7%
  • Метод протестирован и заявлен как SOTA на модели Qwen3.6
  • Код и веса опубликованы на GitHub и Hugging Face (HF)
  • Поддержка метода готовится к добавлению в собственный инференс-движок команды
Что дальше

Поддержка метода должна появиться в инференс-движке команды («скоро доедет»), что позволит применять его в продакшне.

Это произошло: Использование FP4 квантования в продакшене →

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖