vllmСбросить фильтр ×

Перенос KV-кэша между разными LLM: независимая проверка идеи NVIDIA (Cache-2-Cache)

NVIDIA опубликовала статью о переносе KV-кэшiа между разными моделями: маленькая модель делает префилл (читает промпт), большая отвечает, используя её кэш через линейный маппинг — без повторного прогона промпта дорогой моделью. Идея развивает более раннюю концепцию Cache-2-Cache, где обучаемый fuser-модуль передавал в KV-кэш target-модели знания из source-модели; NVIDIA предложила упрощение — обучаемый (в большинстве случаев линейный) проектор, подбирающий наиболее полезные слои source-модели для target-модели.

У статьи NVIDIA не было ни кода, ни анонса — только цифры на 8x H100. Автор одного из телеграм-каналов решил проверить подход на практике: собрал реализацию внутри vLLM на паре Qwen3 0.6B и 1.7B на двух видеокартах 3090 и подтвердил, что метод действительно работает и даёт прирост скорости, хотя и меньший, чем заявляли авторы оригинальной статьи на топовом оборудовании.

ВыводНезависимая реализация: собственный KV-коннектор для vLLM, перенос кэша через /dev/shm, ridge-маппер с решением в замкнутой форме, обучение — 15 минут на датасете FineWeb

x2.22ускорение TTFT в независимом тесте
17-25xзаявленное NVIDIA ускорение на 14B/32B с NVLink
94%сохранённое качество по HellaSwag

Полный разбор →

vLLM опубликовал библиотеку рецептов для инференса моделей

Н@navuka_i_jiznAI-инженер
2 дн
Оказывается у VLLM есть список рецептов с описанием как/что инферить + можно понять сколько какого железа надо под модель. Сохраняйте в закладки (как эта страница мимо меня прошла - ума не приложу ⌨️) https://recipes.vllm.ai/

Вторая часть стрима про AI-агентов: архитектура, инференс и тестирование

К@kdoronin_blogAI-инженер
1 нед

Оптимизация модели Qwen-Image-2512 от ByteShape

Н@GreenNeuralRobotsAI-инженер
3 нед
Qwen-Image-2512 GGFU/Humming Пока Алибаба зажал новые квены, ByteShape оптимизировали старый. • шесть уровней квантизации для GGUF от 8 до 17 ГБ • Humming - экспериментальная интеграция, но быстрее GGUF • для vLLM-Omni: 8–17 ГБ, ускорение в 2–3 раза сравнение с оригинальной моделью #qi2512 #gguf #humming
Оптимизация модели Qwen-Image-2512 от ByteShape

Проблемы использования OpenRouter для разработки AI-агентов

A@oestickAI-инженер
1 мес

DeepSeek представила DSpark: открытый стек для ускорения генерации LLM

Компания DeepSeek выпустила DeepSpec — полностью открытый программный стек для ускорения генерации больших языковых моделей (LLM). Ключевым компонентом стал алгоритм DSpark, который использует метод параллельного драфтинга с динамической настройкой длины черновиков.

Технология позволяет увеличить скорость генерации текста в 1.5–1.85 раза без потери качества. Решение уже внедрено в продакшн-версии моделей DeepSeek-V4 Flash и Pro.

60–85%прирост скорости генерации
16–18%превосходство в acceptance length

Полный разбор →

Это всё на сейчас.