Автор канала The ExtremeCode Times рассказал, почему затянулось производство видео про запуск ИИ-моделей на пачке видеокарт: изначально простая идея «взять видеокарты и запустить на них ИИ» обернулась серией вопросов, главный из которых — как вообще сравнивать между собой разные квантованные версии одной и той же модели.
В итоге вместо готового ролика появилась собственная методология оценки моделей с рабочим названием «GPU & 0-vibe Validation of Next-token Omega-quants», которую автор описывает как «на порядок лучше», чем поверхностные обзоры большинства ютуберов на эту тему.
95%доля ютуберов без практического опыта в теме
4Bразмер модели в примере поверхностного обзора
- Исходная задумка видео была максимально простой: показать запуск ИИ-моделей на имеющейся пачке видеокарт
- Автор признаёт отсутствие практического опыта в теме на старте — как, по его словам, и у 95% других ютуберов, снимающих подобный контент
- Ключевой вопрос, из-за которого затянулось производство: как оценивать разницу между файлами одной модели с разным квантованием
- Расшифровка методологии: G — GPU-hardware (тест декодинга и префилла на потребительском железе), 0 — 0-vibe (насколько модель «мертва» изнутри и способна следовать инструкциям), V — Validation (валидация через LLM as Judgei), N — Next-token (перплексияi и угадывание токенов), O — Omega-quant (сравнение слабых квантов с «альфа»-версией модели)
- Автор сравнивает свой подход с распространённой практикой поверхностных обзоров типа «давайте посмотрим, как 4B модель не сможет сделать дашборд на HTML»
- Методология задумана как задел на будущее — устоявшийся инструмент для оценки новых моделей по мере их выхода
Автор обещает довести методологию до применения на практике и в дальнейшем использовать её как стандартный инструмент для оценки новых локальных моделей.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖