← к ленте

Релиз метода спекулятивного декодинга с ускорением 4.37x

Б@boris_againAI-инженер
1 мес

Представлен новый метод спекулятивного декодинга, обеспечивающий ускорение в 4.37 раза и превосходящий DFlash на 24.7%.

Ну что ж, вот и наш первый релиз на архив.
we achieve a 4.37-fold speedup over autoregressive decoding, and outperform a highly optimized DFlash baseline by 24.7%
Это спекулятивный декодинг. SOTA(ну на qwen3.6 точно). Бьем все, что есть известного в паблике (ну dflash). Супер важная тема для быстрого инференса на устройстве, особенно когда понимаешь задачу. GitHub HF Поддержка в нашем инференс движке скоро доедет

Кратко (AI)

Авторы представили новый метод спекулятивного декодинга, который ускоряет работу моделей в 4.37 раза по сравнению с авторегрессионным подходом. Решение демонстрирует преимущество в 24.7% над оптимизированным методом DFlash и протестировано на модели Qwen3.6.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖