← к ленте

Методология оценки LLM: GPU & 0-vibe Validation

T@extremecodeAI-инженер
4 нед

Авторская методология оценки LLM, включающая тесты производительности на GPU, проверку следования инструкциям и валидацию через LLM-as-a-judge.

Это частная инициатива по созданию системы оценки нейросетей, которая пока не является индустриальным стандартом.

  • Предложенный подход фокусируется на тестировании моделей на потребительском оборудовании.
  • Методология пытается объединить технические метрики производительности с качественной оценкой следования инструкциям.
Рабочее название методологии GPU & 0-vibe Validation of Next-token Omega-quants GGPU-hardware (Тест декодинга и префилла на потребительском железе) 00-vibe (Насколько модель мертва изнутри и способна следовать инструкциям) VValidation (Валидация через LLM as Judge) NNext-token (Перплексия и угадывание токенов) OOmega-quant (Сравнение омежек с альфачом)

Кратко (AI)

Автор предлагает авторскую методологию оценки языковых моделей под названием GPU & 0-vibe Validation of Next-token Omega-quants. Она включает проверку производительности на потребительском железе, оценку способности следовать инструкциям, валидацию через LLM-as-a-judge и анализ перплексии.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖