Проблемы с инференсом модели Kimi
L@lovedeathtransformersAI-инженер
4 недпочему никто не сервит кими нормально с dflash и прочим, типа все понаписали свои инференс движки и теперь "пук пук как сервить"?
Компания DeepSeek выпустила DeepSpec — полностью открытый программный стек для ускорения генерации больших языковых моделей (LLM). Ключевым компонентом стал алгоритм DSpark, который использует метод параллельного драфтинга с динамической настройкой длины черновиков.
Технология позволяет увеличить скорость генерации текста в 1.5–1.85 раза без потери качества. Решение уже внедрено в продакшн-версии моделей DeepSeek-V4 Flash и Pro.
Это всё на сейчас.