Метод переноса признаков между слоями LLM
К@quant_prune_distillAI-инженер
2 днАнализ метода переноса признаков между слоями разных LLM с помощью гребневой регрессии и его эффективности на моделях Qwen3, Llama-3.1 и Ministral.
Исследование предлагает способ переиспользовать знания одной нейросети в другой, что может ускорить обучение или адаптацию моделей.
- Метод позволяет отображать признаки между слоями разных моделей, например, при масштабировании.
- Для эффективного переноса требуется конкатенация признаков из нескольких слоев исходной модели.
- Подход требует значительных вычислительных ресурсов (8×H100) и пока ограничен в универсальности.
🛠️ Метод
Сначала определяют, какие слои лучше всего отображаются из одной модели в другую. Для этого обучают гребневую регрессию (Ridge Regression) между всеми парами слоёв source- и target-модели и находят те, где R² самый большой. При этом важно фитировать pre-RoPE-ключи. Так и ошибка выходит меньше, и на другие контексты экстраполируется лучше.
Замечают, что ключи предсказываются лучше, чем значения. Впрочем, это было известно и из прошлой литературы.
После определения самых важных source-слоёв для данного target-слоя признаки из них конкатенируют в один тензор и снова обучают на этом гребневую регрессию. Показывают, что важно брать не один, а несколько — 4–8 — слоёв из source-модели для приемлемого R².
⏱️ Занимает это час-полтора на ноде из 8×H100.
🧪 Эксперименты
Валидируют подход на моделях семейств Qwen3, Llama-3.1, Ministral и на задачах с коротким ответом: ARC-C, HellaSwag, Winogrande, MMLU.
На паре Qwen3 14B → 32B работает неплохо, на Qwen3 8B → 32B — уже хуже, а на Llama 3.1 и Ministral 3.
В ablation показывают для Qwen, что pre-RoPE важен и что k = 1 — брать один самый важный слой — недостаточно.
Для Ministral 3 можно вытянуть качество, если заменить линейную модель на MLP. Для Qwen3 это не помогает.
Утверждается, что оверхед от маппера из source в target небольшой — в 3–25 раз меньше, чем prefill.
💡 Выводы
Интересное исследование и идея, но будто бы до практического использования ещё далеко. Тесты — на простых бенчах, и будто бы подход не универсален. Для качественного отображения между разными моделями, скорее всего, потребуется более выразительная модель, и здесь возникает сложный trade-off между потенциальным выигрышем, стоимостью работы и обучения этой прокладки.
Кратко (AI)
В посте описывается метод переноса знаний между слоями разных языковых моделей через гребневую регрессию. Исследователи выяснили, что для качественного отображения признаков необходимо использовать несколько слоев исходной модели, а использование pre-RoPE ключей повышает точность экстраполяции.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖