qwen3.6Сбросить фильтр ×

Новый метод спекулятивного декодинга обгоняет DFlash на 24.7%

Команда опубликовала на архиве (arXiv) первый релиз своей разработки — метод спекулятивного декодинга для ускорения инференса языковых моделей. Заявлено ускорение в 4.37 раза по сравнению с обычным автогрессивным декодированием и превосходство над оптимизированным бейзлайном DFlashi на 24.7%.

Авторы называют результат state-of-the-art (SOTA), по крайней мере на модели Qwen3.6 — метод превосходит всё, что публично известно в этой области, включая DFlash. Тема значима для быстрого инференса на устройстве (on-device inference).

4.37-foldускорение декодирования
24.7%превосходство над DFlash

Полный разбор →

Это всё на сейчас.