← к ленте

Сбер выпустил открытую модель GigaChat 3.5 Ultra

Д@disruptors_officialмедиа / агрегатор
1 мес

Сбер представил открытую модель GigaChat 3.5 Ultra с гибридной архитектурой, повышенной эффективностью и лицензией MIT.

Сбер делает ставку на рынок вокруг открытой модели На Хабре пишут, что новая GigaChat 3.5 Ultra (это их флагман на 432 млрд параметров, вчера выкатили в опенсорс) стала на 40% компактнее, но при этом не слабее, а местами даже сильнее: особенно в коде и математике. HumanEval вырос с 70 до 80%, SWE-Bench - с 8,6% до 42,6%. Любопытно, что рост не за счёт железа, а через гибридную архитектуру: Во-первых, у неё скрестили классический MLA-attention (стандартное "внимание" - модель перепроверяет каждое новое слово по всей истории диалога) с линейным вниманием GatedDeltaNet (модель один раз сжимает прочитанное в короткую "выжимку" и дальше дополняет её, а не пересматривает всё заново). Это дало "гибрид", который жрёт в 4 раза меньше памяти на токен и впихивает в ту же память в >2 раз больше контекста. Во-вторых, теперь у модели две MTP-головы. То есть, она сразу прикидывает несколько следующих слов вместо одного, а это серьёзно ускоряет генерацию. Пишут, что по бенчам база модели обходит DeepSeek V3.2 и свежий V4 Flash по среднему баллу (72,3 vs 71,5 и 71,9), а в коде и математике отрывается даже сильнее. Инструктированную версию ещё прогнали через "LLM-судью" и получили win-rate 75,9% против своей же 3.1 Ultra и 68,7% против GPT-5. Нюанс: судья тоже нейросеть, в данном случае взяли MiniMax-M2.7, но всё равно результат достойный. Команду Сбера поздравляю с релизом - судя по цифрам, прогресс большой. И вот что здесь самое интересное: Первое - модель стала эффективнее в разы, а значит, ИИ должен подешеветь. И тут работает парадокс Джевонса: когда ресурс дешевеет, его начинают не экономить, а наоборот использовать сильнее. Так было с углём на паровых машинах Уатта, так было с Дипсиком и его дешёвым обучением. И получается, если инференс в 4 раза экономнее по памяти и вдвое больше контекста влезает в те же ресурсы, то куча сценариев, которые раньше было невыгодно запускать в широкий продакшен (например, длинные агентные цепочки, RAG по объёмным базам, инференс без гигантских кластеров и т.д.) - становятся экономически оправданными. Эффективность тут не про "теперь можно тратить меньше", а про то, что теперь ИИ можно шире внедрять. Второй момент - модель отдали под MIT, а это самая "разрешительная" опенсорсная лицензия: разворачивайте где угодно (хоть в чужом облаке), дорабатывайте, зарабатывайте на этом как хотите. Это похоже на историю Linux и Android: вокруг ядра выстраивается открытая база, на которой сам вырастает рынок. Так уже работают Llama, DeepSeek или Qwen, но у Сбера раскрыты не только веса модели, но и сам рецепт обучения - код гейтов, архитектурные решения, детали стабилизации гибрида и т.д. Сами авторы прямо пишут зачем: чтобы подходы проверяло сообщество, а не только внутренние бенчмарки. А это повышает готовность внедрять. В общем, у этого релиза простая и рациональная логика: чем дешевле и доступнее сама модель, тем больше её будут внедрять в каждый угол. А значит, ценность модели будет повышаться за счёт всего, что строится вокруг неё. Дизраптор

Кратко (AI)

Сбер представил открытую модель GigaChat 3.5 Ultra, которая использует гибридную архитектуру для повышения эффективности и скорости генерации. Модель распространяется по лицензии MIT, что делает её доступной для широкого коммерческого использования и доработки сообществом.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖