Cross-Model KV Cache Transfer: метод передачи знаний между LLM
К@quant_prune_distillAI-инженер
2 днОбзор метода Cache-2-Cache и нового подхода NVIDIA по переносу KV-кэша между разными LLM для оптимизации префилла и генерации.
Технология позволяет ускорить работу нейросетей, переиспользуя результаты их «размышлений» между разными моделями.
- Позволяет делегировать тяжелый префилл мощным моделям, а генерацию — более быстрым и дешевым.
- Снижает вычислительные затраты при работе с длинными контекстами.
- Метод линейного проецирования упрощает интеграцию разных моделей в единый пайплайн.
Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse
📄 Статья:
Нередко интересующую задачу можно разбить между несколькими LLM-ками, делегировав более простые куски бюджетным моделям, а сложные — самым топовым и дорогим.
Коммуникацию можно построить через текст, однако внутренние представления, в частности KV-кэш, могут содержать гораздо больше полезной информации.
В работе Cache-2-Cache рассматривается следующая постановка:
1. 🔹 Source- и target-модели делают префилл.
2. 🔹 Обучаемый fuser-модуль выдаёт добавку к target-модели, которая в некотором смысле передаёт знания из source-модели.
Практически интересны два сценария:
- 🧠 Делаем префилл большой моделью и достаточно длинную генерацию маленькой моделью. Надеемся, что мощный префилл зарешает.
- ⚡ Делаем большой префилл маленькой моделью и короткую генерацию большой моделью. Авось большая модель переварит выдачу малой модели и выдаст точный ответ.
Однако в исходной статье префилл, по-любому, приходится делать двумя моделями, и обучение fuser может быть недешёвым.
Ребята из NVIDIA предложили обучать проектор, в большинстве случаев линейный, из одной модели в другую, подобрав для target-модели наиболее полезные слои из source-модели, — и оно более-менее завелось.
Кратко (AI)
В статье рассматривается проблема передачи KV-кэша между различными языковыми моделями для повышения эффективности вычислений. Исследователи NVIDIA предложили использовать линейный проектор для переноса представлений между слоями разных моделей, что позволяет использовать результаты префилла одной модели в другой.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖