← к ленте

Разработка методологии оценки локальных LLM

T@extremecodeAI-инженер
1 мес

Автор рассказывает о процессе создания собственной методики тестирования и сравнения квантованных локальных нейросетей для будущего видео.

Появление независимых методик оценки нейросетей помогает лучше понимать реальную производительность моделей вне маркетинговых тестов.

  • Позволяет объективно сравнивать разные уровни квантования одной модели.
  • Снижает зависимость от поверхностных обзоров, основанных на субъективных впечатлениях.
Короче, рассказываю почему производство видоса про сраный локальный нейрослоп затянулось. Изначально была крайне тупорылая задумка — вот у меня есть пачка видеокарт, давайте запускать на нем ИИ, хихи-хаха. Какого-то практического опыта у меня естественно не было (да как походу блин и у 95% других ютуберов, которые снимают про это всякую шляпу и продолжают это делать бездарно, это не упрек, просто факт). Естественно, когда я начал разбираться с тем, как вообще это сделать, возникали вопросы. И чем глубже я погружался в тему, тем больше вопросиков возникало, некоторые из них даже могли показаться крайне тупорылыми. Но меня это реально волновало. Один из десятков таких вопросов — а как ваще оценивать модели относительно друг друга. Вот есть пачка файлов одной модели по разному квантованных, как вообще мне понять какая между ними разница? В итоге это все переросло в разработку собственной "гаражной" методологии оценки моделей по определенным ключевым параметрам. Да, конечно, она не сравнится с методами от навучных чуваков, которое это придумывают их сидя на зарплатке, но это на порядок лучше чем "гыыы, давайте посмотрим на то, как 4B модель не сможет сделать дашборд на HTML". Ну и это задел на будущее, т.к. уже будет простая и устоявшаяся метода для оценок новых моделей. В общем, терпим и ждем.
Разработка методологии оценки локальных LLM

Кратко (AI)

Автор делится процессом подготовки видео о запуске локальных нейросетей на домашних видеокартах. В ходе работы он столкнулся с проблемой отсутствия качественных методов сравнения моделей и разработал собственную «гаражную» методологию оценки, которая станет основой для будущих обзоров.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖