gptqСбросить фильтр ×

Влияние 2-битной квантизации на поведение reasoning-моделей

К@quant_prune_distillAI-инженер
1 мес

Квантизованные reasoning-модели «переосмысливают» ответы — и это можно вылечить занижением 50 токенов

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 1 мес назад

Команда из Meta исследовала, почему квантизованные reasoning-модели теряют в качестве сильнее, чем модели, квантизованные для обычных задач. Оказалось, что дело не только в потере точности вычислений, а в специфическом эффекте overthinkingi: модель зацикливается в рассуждениях и даже получив верный ответ на промежуточном шаге, в итоге выдаёт другой, ошибочный.

Авторы нашли простой и эффективный способ борьбы с этим: заниженные логиты для 50 вручную отобранных «overthinking-токенов» (вроде «Wait», «But», «Alternatively») одновременно сокращают длину ответа и повышают качество — важный практический результат для тех, кто использует квантизацию reasoning-моделей в проде.

ВыводРассмотрены варианты квантизации: weight-only AWQ и GPTQ в 3 и 4 бита, а также weight+activation+KV-cache квантизация в 4 и 8 бит через FlatQuant

5–15%прирост качества после занижения логитов
10–20%сокращение длины ризонинга
50число вручную отобранных overthinking-токенов

Полный разбор →

Это всё на сейчас.