kv-cacheСбросить фильтр ×

Перенос KV-кэша между разными LLM: независимая проверка идеи NVIDIA (Cache-2-Cache)

NVIDIA опубликовала статью о переносе KV-кэшiа между разными моделями: маленькая модель делает префилл (читает промпт), большая отвечает, используя её кэш через линейный маппинг — без повторного прогона промпта дорогой моделью. Идея развивает более раннюю концепцию Cache-2-Cache, где обучаемый fuser-модуль передавал в KV-кэш target-модели знания из source-модели; NVIDIA предложила упрощение — обучаемый (в большинстве случаев линейный) проектор, подбирающий наиболее полезные слои source-модели для target-модели.

У статьи NVIDIA не было ни кода, ни анонса — только цифры на 8x H100. Автор одного из телеграм-каналов решил проверить подход на практике: собрал реализацию внутри vLLM на паре Qwen3 0.6B и 1.7B на двух видеокартах 3090 и подтвердил, что метод действительно работает и даёт прирост скорости, хотя и меньший, чем заявляли авторы оригинальной статьи на топовом оборудовании.

ВыводНезависимая реализация: собственный KV-коннектор для vLLM, перенос кэша через /dev/shm, ridge-маппер с решением в замкнутой форме, обучение — 15 минут на датасете FineWeb

x2.22ускорение TTFT в независимом тесте
17-25xзаявленное NVIDIA ускорение на 14B/32B с NVLink
94%сохранённое качество по HellaSwag

Полный разбор →

AI-стек застрял на «mainframe-стадии»: почему модели общаются текстом и что теряют

Автор проводит аналогию с историей компьютерных систем: любой computing stacki раньше был монолитным и разбивался на модули только тогда, когда для этого появлялся стандартный интерфейс. AI-стек, по его мнению, до сих пор находится на «mainframe-стадии» — то есть работает как одна гигантская модель, потому что интерфейса для декомпозиции не существует.

Причина в том, что единственный способ передачи данных между моделями сейчас — текст, а текст — это финальный summary всех внутренних вычислений модели. Из-за этого при каждой передаче от одной модели к другой почти вся «настоящая работа» внутри модели просто выбрасывается, и накопления capability между моделями не происходит.

2xприрост скорости в Cache-to-Cache при передаче KV-cache

Полный разбор →

Это всё на сейчас.