Liquid AI представила метод Quantization-Aware Distillation для 4-битных моделей
M@machinelearning_interviewAI-инженер
1 недLiquid AI выпустила Q4_0-чекпоинты для моделей LFM2.5, использующие Quantization-Aware Distillation для сохранения качества уровня BF16.
Новый метод обучения позволяет запускать компактные нейросети на слабых устройствах без потери качества.
- Позволяет использовать 4-битные модели с точностью, близкой к полноразмерным.
- Не требует изменения runtime или формата GGUF, сохраняя высокую скорость работы.
- Делает запуск мощных ИИ-моделей доступным на смартфонах и одноплатных компьютерах.
⚡️ Liquid AI выжала почти BF16-качество из 4-битных моделей
Компания выпустила новые Q4_0-чекпоинты для LFM2.5-230M, 350M, 1.2B и 2.6B, обученные через Quantization-Aware Distillation.
Суть QAD простая: высокоточная модель выступает учителем для уже квантованной 4-битной версии. В итоге сохраняются низкое потребление памяти и высокая скорость Q4_0, но заметно возвращается качество, потерянное после обычной квантизации.
По тестам Liquid AI новые модели сохраняют примерно 96,5–97,4% качества BF16. Для младших моделей QAD закрывает больше 70% разрыва между обычным Q4_0 и BF16.
При этом скорость инференса остается на уровне обычного Q4_0, потому что формат GGUF, layout тензоров и runtime не меняются. Тестировали в том числе на MacBook Pro с M5 Max, Galaxy S26 Ultra и Raspberry Pi 5.
https://liquid.ai/blog/qad

Кратко (AI)
Компания Liquid AI представила метод Quantization-Aware Distillation (QAD), позволяющий 4-битным моделям сохранять качество, близкое к формату BF16. Новые чекпоинты для линейки LFM2.5 демонстрируют высокую точность при сохранении скорости инференса стандартного формата Q4_0.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖