Автор канала The ExtremeCode Times поднял проблему: стандартные метрики (perplexityi, MMLUi) показывают лишь небольшую просадку у квантованных моделей по сравнению с оригинальными весами, но это плохо соотносится с реальным ощущением деградации при ручном тестировании. Методика, которая работает для выбора лучшей модели среди нескольких кандидатов (прогнать через бенчмарк и взять максимум баллов), не подходит для оценки, насколько именно «поглупела» модель после квантования.
- По наблюдению автора, у квантованной модели perplexity растёт «на пару процентов», а результат MMLU падает «чуточку» — оба показателя выглядят некритичными
- Вариант «потыкать руками 5 минут и прийти к выводу, что она тупая» автор считает неадекватным методом оценки
- На следующий день автор обращает внимание на явную «яму» в бенчмарке у однобитного i-кванта модели, называя её результат неприемлемо низким
- Автор прямо спрашивает аудиторию («экспертов из каментов»), можно ли придумать альтернативную метрику, если существующие не отражают степень деградации от квантизации
- Задача сравнивается с выбором лучшей модели среди 10 разных «от дилеров» — там бенчмарк работает просто (максимум баллов = победитель), но для квантованных версий такой подход, по мнению автора, не работает
Автор явно ищет от читателей рабочую методику или метрику для оценки деградации квантованных моделей взамен perplexity и MMLU; ответа или решения в источниках не приведено.
Это произошло: Квантованные модели склонны к избыточным рассуждениям →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖