Методика оценки качества квантованных моделей
T@extremecodeAI-инженер
3 недАвтор делится предварительными результатами разработки собственной методики оценки деградации квантованных LLM, критикуя текущие стандарты бенчмарков.
Разработчики ищут способы более точной оценки качества сжатых нейросетей.
- Стандартные тесты часто не учитывают потерю качества при квантовании моделей.
- Новый подход может помочь эффективнее выбирать модели для реальных задач.
- Оптимизация тестирования позволяет снизить затраты на использование API.
Ёпта, кажется моя методика оценки "G0VNO" квантованных моделей реально работает (но это не точно, пока только предварительные результаты без массового прогона).
Чувствую себя поехавшим датасаентистом. Мне бля даже интересно стало, а какого хрена раньше до этого никто не додумался.
Обычно дилер модельки фигачит в ридми результаты модели, которых она набирает в FP16 на сраных публичных бенчмарках. А вот то, насколько она деграднула после сжатия — как будто бы и насрать всем, а на самом деле результаты могут ПИЗДЕЦ КАК СИЛЬНО отличаться.
Замер перплексии сам по себе хорош только для предварительной оценки, но не показывает реальной раскладки на настоящих задачах.
Ща сижу думаю, как не разориться на токенах, думаю после предварительного прогона перплексии брать только 3 самых лучших модели, а остальных отсекать из-за тупорылости.

Кратко (AI)
Автор разрабатывает новый метод оценки качества квантованных моделей, утверждая, что стандартные бенчмарки в FP16 не отражают реальную деградацию после сжатия. В планах — оптимизация процесса тестирования через предварительный отсев моделей по показателю перплексии для экономии ресурсов.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖