← к ленте

Реализация переноса KV-кэша между моделями в vLLM

К@quant_prune_distillAI-инженер
2 дн

Автор реализовал перенос KV-кэша между моделями Qwen3 0.6B и 1.7B в vLLM, добившись ускорения TTFT в 2.22 раза на длинном контексте.

Этот метод позволяет значительно ускорить работу нейросетей с длинными текстами.

  • Снижает время ожидания первого ответа (TTFT) более чем в два раза.
  • Позволяет использовать маленькую модель для обработки промпта, а большую — для генерации ответа.
  • Особенно эффективно для задач с длинным контекстом, где предварительная обработка данных занимает больше всего времени.
NVIDIA на днях выложила статью про перенос KV-кэша между разными моделями: маленькая модель читает промпт, большая отвечает из её кэша через линейный маппинг. Кода нет, анонса нет, ничего нет, только цифры с 8x H100. Ну я и решил проверить 🤨 Взял пару Qwen3 0.6B и 1.7B, две 3090, и собрал всё внутри vLLM, а не на синтетике: свой KV-коннектор, перенос через /dev/shm, ridge-маппер замкнутой формулой, 15 минут фита на FineWeb. Живёт всё как KV Connector для вллм. Оно работает 😫 HellaSwag держит 94% качества, перплексия хуже всего на 10%. TTFT на 32K контексте падает с 3657 до 1645 мс, в x2.22 🤌🏻 Под конкурентностью 8 прогретый путь тоже гуд, 2393 против 3928 мс на запрос, ноль сбоев за все прогоны. У авторов 17-25x на паре 14B и 32B с NVLink, у меня 2.22x на PCIe, и короткие промпты проигрывают накладным расходам переноса. Окупается это дело на длинном контексте, где prefill больнее всего 📉 Код, коннектор и оба обученных маппера выложил 👇 https://github.com/alesha-pro/vllm-cross-model-kv https://huggingface.co/anonymousmaharaj/vllm-cross-model-kv
Реализация переноса KV-кэша между моделями в vLLM
КонтекстAI
NVIDIA недавно опубликовала исследование о возможности передачи KV-кэша (промежуточных состояний внимания) от маленькой модели к большой для ускорения генерации. Автор поста реализовал этот подход на практике, адаптировав его для работы в популярном движке vLLM.

Кратко (AI)

Автор воспроизвел метод NVIDIA по переносу KV-кэша между моделями разного размера, используя Qwen3 0.6B и 1.7B в среде vLLM. Решение показывает ускорение времени до первого токена (TTFT) в 2.22 раза на длинном контексте при сохранении 94% качества на бенчмарке HellaSwag.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖