Методология оценки LLM: GPU & 0-vibe Validation
T@extremecodeAI-инженер
4 недАвторская методология оценки LLM, включающая тесты производительности на GPU, проверку следования инструкциям и валидацию через LLM-as-a-judge.
Это частная инициатива по созданию системы оценки нейросетей, которая пока не является индустриальным стандартом.
- Предложенный подход фокусируется на тестировании моделей на потребительском оборудовании.
- Методология пытается объединить технические метрики производительности с качественной оценкой следования инструкциям.
Рабочее название методологии GPU & 0-vibe Validation of Next-token Omega-quants
G — GPU-hardware (Тест декодинга и префилла на потребительском железе)
0 — 0-vibe (Насколько модель мертва изнутри и способна следовать инструкциям)
V — Validation (Валидация через LLM as Judge)
N — Next-token (Перплексия и угадывание токенов)
O — Omega-quant (Сравнение омежек с альфачом)
Кратко (AI)
Автор предлагает авторскую методологию оценки языковых моделей под названием GPU & 0-vibe Validation of Next-token Omega-quants. Она включает проверку производительности на потребительском железе, оценку способности следовать инструкциям, валидацию через LLM-as-a-judge и анализ перплексии.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖