Команда опубликовала на архиве (arXiv) первый релиз своей разработки — метод спекулятивного декодинга для ускорения инференса языковых моделей. Заявлено ускорение в 4.37 раза по сравнению с обычным автогрессивным декодированием и превосходство над оптимизированным бейзлайном DFlashi на 24.7%.
Авторы называют результат state-of-the-art (SOTA), по крайней мере на модели Qwen3.6 — метод превосходит всё, что публично известно в этой области, включая DFlash. Тема значима для быстрого инференса на устройстве (on-device inference).
4.37-foldускорение декодирования
24.7%превосходство над DFlash