Анализ возможностей GigaChat 3.5 в агентном кодинге
A@ai_drivenAI-инженер
1 месРазбор новой модели GigaChat 3.5 от Сбера: сравнение с конкурентами в агентном кодинге и критика текущих бенчмарков.
GigaChat 3.5 - что по кодингу?
Пока мы все ждем релиз GPT-5.6, в каналах все чаще наблюдаю анонсы новой модели от Сбера. Очевидно, что работа была проделана немаленькая, поэтому поздравляю ребят с релизом! Там действительно получился довольно большой скачок в сравнении с их предыдущей моделью, а в пабликах часто наблюдаю как пишут, что уровень модели сопоставим, либо даже выше, чем DeepSeek V3.2. Но для нас главный вопрос - что с агентным кодингом? Поскольку мне Сбер денег не занес, придется писать правду.
И тут главная проблема в том, что из официального релиза это практически не понятно. Т. к. единственный прямой agentic coding бенчмарк, который опубликовала команда - это Terminal Bench 2 (в этом месте хочется позанудствовать, что не существует бенчмарка Terminal Bench 2, а существует Terminal Bench 2.0 и более честная его версия Terminal Bench 2.1 - догадаемся, что речь про 2.0). Причем даже в нем мы видим сравнение только с DeepSeek V3.2 и GigaChat 3.1 Ultra. Ну что ж, мы не из робкого десятка, поэтому соберем результаты других моделям по крупицам из других источников. Например, результаты Terminal Bench 2.0/2.1 удобно смотреть здесь и здесь.
GigaChat-3.5-Ultra: 13.48 (харнесс Terminus 2, данные от команды сбера)
GPT-OSS-120B: 18.7 (Terminus 2, данные из лидерборда tbench)
Qwen3.6-35B-A3B: 24.6 (харнесс little-coder)
DeepSeek-3.2: 39.6 (Terminus 2)
Nemotron 3 Ultra (550B-A55): 50.94 (Terminus 2, результаты из vals.ai)
Тем не менее, наверное, на рынке РФ из отечественных моделей, похоже, что GigaChat 3.5 пока самая сильная модель. Но объективно сказать трудно, т. к. ни Яндекс, ни Сбер более широкого сравнения не публикуют и друг друга в бенчмарки не добавляют - а зря, ведь современные бенчмарки достаточно легко прогоняются через Harbor, нужны только токены.
А к колегам по цеху предложение на будущее публиковать System Card модели с техническими подробностями, как это делают OpenAI и Anthropic, а также показывать больше современных бенчмарков: хотя бы DeepSWE 1.1 и SWE-rebench 2.0.
@ai_driven
Кратко (AI)
Автор анализирует возможности новой модели GigaChat 3.5 в задачах агентного кодинга, сравнивая её с конкурентами на основе доступных бенчмарков. В статье отмечается нехватка прозрачных данных от разработчиков и предлагается использовать более современные стандарты тестирования, такие как DeepSWE 1.1 и SWE-rebench 2.0.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖