Команда из Meta исследовала, почему квантизованные reasoning-модели теряют в качестве сильнее, чем модели, квантизованные для обычных задач. Оказалось, что дело не только в потере точности вычислений, а в специфическом эффекте overthinkingi: модель зацикливается в рассуждениях и даже получив верный ответ на промежуточном шаге, в итоге выдаёт другой, ошибочный.
Авторы нашли простой и эффективный способ борьбы с этим: заниженные логиты для 50 вручную отобранных «overthinking-токенов» (вроде «Wait», «But», «Alternatively») одновременно сокращают длину ответа и повышают качество — важный практический результат для тех, кто использует квантизацию reasoning-моделей в проде.
5–15%прирост качества после занижения логитов
10–20%сокращение длины ризонинга
50число вручную отобранных overthinking-токенов
- Рассмотрены варианты квантизации: weight-only AWQ и GPTQ в 3 и 4 бита, а также weight+activation+KV-cache квантизация в 4 и 8 бит через FlatQuanti
- Тестировали на математике, GPQA-Diamond (общие научные вопросы) и LiveCodeBench (кодинг), на дистиллах DeepSeek и QwQ
- 3-битная квантизация весов и 4-битная квантизация весов+активаций заметно просаживают качество и увеличивают длину ризонинга; длина ризонинга и качество коррелируют негативно — чем длиннее рассуждение, тем хуже итоговый ответ
- Резкий рост доли overthinking-маркеров («Wait», «But», «Alternatively») совпадает с позициями высокой KL-дивергенции между выходами исходной и квантизованной модели
- Занижение логитов 50 вручную отобранных overthinking-токенов улучшает качество на 5–15% и сокращает длину ризонинга на 10–20%, снижая долю overthinking-ошибок в два и более раза
- Baseline-стратегии слабее: пенализация high-KL-токенов работает, но хуже ручного выбора; пенализация случайных токенов не даёт эффекта; пенализация low-KL-токенов только вредит качеству и удлиняет ризонинг
- Гипотеза авторов: токены с высокой энтропией имеют размазанное распределение вероятностей, поэтому даже малый квантизационный шум легко переключает выбор именно на overthinking-токен
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖