ИИllmквантованиебенчмаркидата-сайенсперплексияМетодика оценки качества квантованных моделейT@extremecodeAI-инженер3 недЁпта, кажется моя методика оценки "G0VNO" квантованных моделей реально работает (но это не точно, пока только предварительные результаты без массового прогона). Чувствую себя поехавшим датасаентистом. Мне бля даже интересно стало, а какого хрена раньше до этого никто не додумался. Обычно дилер модельки фигачит в ридми результаты модели, которых она набирает в FP16 на сраных публичных бенчмарках. А вот то, насколько она деграднула после сжатия — как будто бы и насрать всем, а на самом деле результаты могут ПИЗДЕЦ КАК СИЛЬНО отличаться. Замер перплексии сам по себе хорош только для предварительной оценки, но не показывает реальной раскладки на настоящих задачах. Ща сижу думаю, как не разориться на токенах, думаю после предварительного прогона перплексии брать только 3 самых лучших модели, а остальных отсекать из-за тупорылости.llmквантованиебенчмаркидата-сайенсперплексия