Тестирование модели Qwen3.5 4B на сложных задачах разработки
T@extremecodeAI-инженер
3 недРазработчик делится опытом тестирования модели Qwen3.5 4B на собственном датасете из сложных задач по стеку JS/Node.js/React/DB.
Оценка пригодности компактных языковых моделей для решения профессиональных задач разработки.
- Малые модели (4B) показывают низкую эффективность в сложных задачах уровня middle-senior.
- Для качественной оценки LLM требуются специализированные датасеты, а не базовые алгоритмические тесты.
- Следование инструкциям остается критической проблемой для компактных моделей.
Мда ёпта, 12 с копейками часов на 4B модельку и 6 млн слитых токенов на судейку. В бенче ровно 100 вопросов.
В ходе предварительных тестов понял, что вообще нет никакого смысла гонять по базовым алгоритмическим вопросам. С этими задачами даже 4B модель зажатая до одного бита прекрасно справится, а если миксовать сложные и простые вопросы, то результаты размытые будут.
В общем, зафигачил пока датасет с хардкорными задачками уровня мидл-сеньор по стеку JS/Nodejs/Express/React/Mongodb/Postgresql/Redis. И что вы мне сделаете? Я вообще-то G0VNO изобрел, на какой стек мозгов хватило, тот и гоняю.
Помимо саммари, еще складирую все решения судейки отдельно, что б можно было посмотреть че там происходит. Конкретно у Qwen3.5 4B жОские проблемы со следованием инструкций, ну и естественно ей не хватает параметров
P.S.
По шкале вайб скор, модель должна хотя бы 60% в среднем набрать, в таком случае она с большей частью задач справилась, хоть и с небольшими, но терпимыми, косяками

Кратко (AI)
Автор проводит тестирование модели Qwen3.5 4B на специально созданном датасете из 100 сложных задач по стеку JS/Node.js/React/DB. В ходе эксперимента выяснилось, что модель испытывает трудности со следованием инструкциям и ей не хватает параметров для решения задач уровня middle-senior.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖