← к ленте

Как адекватно оценить деградацию квантованных LLM

T@extremecodeAI-инженер
1 мес

Разбор методов оценки качества квантованных моделей: почему бенчмарки не всегда показательны и как измерить реальную деградацию нейросетей.

Эксперты из каментов, объясните, как можно адекватно определить степень отупевания квантованной модели в сравнении с моделью с оригинальными весами? > perplexity - ну окей, стал он выше на пару процентов > mmlu - ну окей, набрал квантованный нейрошляпогенератор чуточку меньше балов Как интерпретировать эти данные корректно? Как в итоге на практике понять реальную степень одебиления? Вариант — потыкать руками 5 минут и прийти к выводу, что "она тупая" не подходит. Помогите выкупить, я не выкупаю. Я понимаю, когда у нас есть условно говоря 10 моделей от разных дилеров и нам надо выбрать лучшую. Прогнали их все через бенчмарк — выбрали ту, что набрала больше всего баллов, изи. А вот методика проверки квантованных моделей чето пока далека от меня.

Кратко (AI)

Автор поста ищет способы объективной оценки деградации качества (отупевания) квантованных языковых моделей. Он отмечает, что стандартные метрики, такие как perplexity и MMLU, не дают полного представления о реальном поведении модели на практике, и просит совета по методологии тестирования.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖