← к ленте

Тестирование модели Qwen3.5 4B на сложных задачах разработки

T@extremecodeAI-инженер
3 нед

Разработчик делится опытом тестирования модели Qwen3.5 4B на собственном датасете из сложных задач по стеку JS/Node.js/React/DB.

Оценка пригодности компактных языковых моделей для решения профессиональных задач разработки.

  • Малые модели (4B) показывают низкую эффективность в сложных задачах уровня middle-senior.
  • Для качественной оценки LLM требуются специализированные датасеты, а не базовые алгоритмические тесты.
  • Следование инструкциям остается критической проблемой для компактных моделей.
Мда ёпта, 12 с копейками часов на 4B модельку и 6 млн слитых токенов на судейку. В бенче ровно 100 вопросов. В ходе предварительных тестов понял, что вообще нет никакого смысла гонять по базовым алгоритмическим вопросам. С этими задачами даже 4B модель зажатая до одного бита прекрасно справится, а если миксовать сложные и простые вопросы, то результаты размытые будут. В общем, зафигачил пока датасет с хардкорными задачками уровня мидл-сеньор по стеку JS/Nodejs/Express/React/Mongodb/Postgresql/Redis. И что вы мне сделаете? Я вообще-то G0VNO изобрел, на какой стек мозгов хватило, тот и гоняю. Помимо саммари, еще складирую все решения судейки отдельно, что б можно было посмотреть че там происходит. Конкретно у Qwen3.5 4B жОские проблемы со следованием инструкций, ну и естественно ей не хватает параметров P.S. По шкале вайб скор, модель должна хотя бы 60% в среднем набрать, в таком случае она с большей частью задач справилась, хоть и с небольшими, но терпимыми, косяками
Тестирование модели Qwen3.5 4B на сложных задачах разработки

Кратко (AI)

Автор проводит тестирование модели Qwen3.5 4B на специально созданном датасете из 100 сложных задач по стеку JS/Node.js/React/DB. В ходе эксперимента выяснилось, что модель испытывает трудности со следованием инструкциям и ей не хватает параметров для решения задач уровня middle-senior.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖