← к ленте

Liquid AI представила метод Quantization-Aware Distillation для 4-битных моделей

1 нед

Liquid AI выпустила Q4_0-чекпоинты для моделей LFM2.5, использующие Quantization-Aware Distillation для сохранения качества уровня BF16.

Новый метод обучения позволяет запускать компактные нейросети на слабых устройствах без потери качества.

  • Позволяет использовать 4-битные модели с точностью, близкой к полноразмерным.
  • Не требует изменения runtime или формата GGUF, сохраняя высокую скорость работы.
  • Делает запуск мощных ИИ-моделей доступным на смартфонах и одноплатных компьютерах.
⚡️ Liquid AI выжала почти BF16-качество из 4-битных моделей Компания выпустила новые Q4_0-чекпоинты для LFM2.5-230M, 350M, 1.2B и 2.6B, обученные через Quantization-Aware Distillation. Суть QAD простая: высокоточная модель выступает учителем для уже квантованной 4-битной версии. В итоге сохраняются низкое потребление памяти и высокая скорость Q4_0, но заметно возвращается качество, потерянное после обычной квантизации. По тестам Liquid AI новые модели сохраняют примерно 96,5–97,4% качества BF16. Для младших моделей QAD закрывает больше 70% разрыва между обычным Q4_0 и BF16. При этом скорость инференса остается на уровне обычного Q4_0, потому что формат GGUF, layout тензоров и runtime не меняются. Тестировали в том числе на MacBook Pro с M5 Max, Galaxy S26 Ultra и Raspberry Pi 5. https://liquid.ai/blog/qad
Liquid AI представила метод Quantization-Aware Distillation для 4-битных моделей

Кратко (AI)

Компания Liquid AI представила метод Quantization-Aware Distillation (QAD), позволяющий 4-битным моделям сохранять качество, близкое к формату BF16. Новые чекпоинты для линейки LFM2.5 демонстрируют высокую точность при сохранении скорости инференса стандартного формата Q4_0.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖