← к ленте

Исследование влияния квантизации на overthinking в LLM

К@quant_prune_distillAI-инженер
1 мес

Анализ влияния квантизации на качество рассуждений LLM и метод борьбы с overthinking через пенализацию специфических токенов.

🧪 Метод и эксперименты Авторы рассматривают следующие варианты квантизации: * 🔹 weight-only AWQ в 3 и 4 бита; * 🔹 weight-only GPTQ в 3 и 4 бита; * 🔹 weight + activation + KV-cache-квантизация в 4 и 8 бит при помощи FlatQuant. Качество оценивают на задачах по математике, общим научным вопросам (GPQA-Diamond) и кодингу (LiveCodeBench). В качестве моделей рассматривают дистиллы дипсика и QwQ (почему не Квен / Квен-3.5?). Менее агрессивные квантизации не так сильно меняют выход, но 3-битная квантизация весов и 4-битная квантизация весов + активаций заметно просаживают качество и одновременно увеличивают длину ризонинга. Причём длина ризонинга и качество имеют негативную корреляцию: чем длиннее ризонинг, тем хуже качество. Анализируя ответы, авторы замечают, что сильно повышается доля токенов — overthinking markers — вида “Wait”, “But”, “Alternatively” и т. п. Кроме того, они обычно соответствуют позициям, где KL-дивергенция между выходами исходной и квантизованной моделей велика. Для того чтобы побороть явление overthinking, предлагают занижать логиты, отвечающие за 50 вручную отобранных overthinking-токенов. В качестве бейзлайнов рассматривают случайные токены и токены с низкой / высокой KL-дивергенцией между сжатой и несжатой моделями. 📈 Занижение логитов отобранных токенов консистентно улучшает качество на 5–15%, при этом длина ризонинга сокращается на 10–20%. В основном прирост качества достигается как раз за счёт решения проблемы overthinking — доля таких ошибок снижается в два и более раза. Из альтернативных стратегий пенализация high-KL-токенов тоже работает неплохо, но хуже, чем пенализация вручную отобранных. Пенализация случайных токенов ничего не даёт, а low-KL-токенов только просаживает качество и удлиняет ризонинг. 💡 Гипотеза авторов о природе явления состоит в том, что токены с высокой энтропией имеют сильно размазанное распределение вероятностей, поэтому даже малый шум может привести к выбору другого токена — чаще всего как раз одного из overthinking-токенов. 📝 Выводы Интересное наблюдение и простое решение для повышения качества работы, которое легко внедряется. Было бы хорошо проверить справедливость полученных в работе выводов на квантизации больших и не очень МоЕшек в агентских задачах. Сохранил исходную стилистику, терминологию и неформальные формулировки.

Кратко (AI)

Авторы исследуют, как различные методы квантизации влияют на качество рассуждений моделей, обнаруживая корреляцию между сжатием и появлением «overthinking» токенов. Предложенный метод занижения логитов для 50 специфических токенов позволяет повысить точность ответов и сократить избыточную длину рассуждений.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖