we achieve a 4.37-fold speedup over autoregressive decoding, and outperform a highly optimized DFlash baseline by 24.7%Это спекулятивный декодинг. SOTA(ну на qwen3.6 точно). Бьем все, что есть известного в паблике (ну dflash). Супер важная тема для быстрого инференса на устройстве, особенно когда понимаешь задачу. GitHub HF Поддержка в нашем инференс движке скоро доедет
Релиз метода спекулятивного декодинга с ускорением 4.37x
C@chillhousetechAI-инженер
1 месПредставлен новый метод спекулятивного декодинга, обеспечивающий ускорение в 4.37 раза и превосходящий DFlash на 24.7%.
Ну что ж, вот и наш первый релиз на архив.
Кратко (AI)
Авторы представили новый метод спекулятивного декодинга, который ускоряет работу моделей в 4.37 раза по сравнению с авторегрессионным подходом. Решение демонстрирует преимущество в 24.7% над оптимизированным методом DFlash и протестировано на модели Qwen3.6.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖