← к умной ленте

Сбер выпустил в открытый доступ флагманскую модель GigaChat 3.5 Ultra

AI-редакция
17 источников · показать все· свернуть
Сергей Марков: машинное обучение, искусство и шитпостингВыход GigaChat 3.5 Ultra: новая open source модельMashkka про Data ScienceВыход GigaChat 3.5 Ultra в open sourcevc.ruСбер представил модель GigaChat 3.5 UltraNEURO-AI Новости ИИСбер выпустил GigaChat 3.5 Ultraэйай ньюзДетали реализации модели GigaChat 3.5 UltraCodeCampСбер выпустил open-source модель GigaChat 3.5 Ultra3DNewsСбер выпустил модель GigaChat 3.5 UltraData SecretsСбер выпустил GigaChat 3.5 Ultra в open sourceБорис опятьВыход GigaChat 3.5 Ultra: новая open source модельMachinelearningСбер выпустил GigaChat 3.5 Ultra в open sourceMachine learning InterviewСбер выпустил GigaChat 3.5 Ultra в open sourceGPT/ChatGPT/AI Central Александра ГорногоСбер выпустил GigaChat 3.5 Ultra в open sourceМетаверсище и ИИщеСбер выпустил GigaChat 3.5 Ultra в open sourceРестартСбер выпустил GigaChat 3.5 Ultra в open-sourceNot Boring TechСбер выпустил GigaChat 3.5 Ultra в open sourceAI-Driven Development. Родион МостовойАнализ агентных возможностей GigaChat 3.5 432B и предложения по развитиюДизрапторСбер выпустил открытую модель GigaChat 3.5 Ultra
хайп · 17обновлено 1 мес назад

6 июля 2026 года Сбер опубликовал в open source новую флагманскую LLM GigaChat 3.5 Ultra — модель на 432 млрд параметров под MIT-лицензией. Это первый в открытом доступе гибрид архитектур GatedDeltaNeti (линейное внимание) и MLA (классическое внимание), доведённый до масштаба сотен миллиардов параметров; рецепт обучения для него собирали в более чем 1500 экспериментах. Модель встроена в ИИ-помощника GigaChat, а веса выложены на HuggingFace и GitVerse.

При этом GigaChat 3.5 Ultra стала на 40% компактнее предыдущего флагмана GigaChat 3.1 Ultra (по данным «Рестарт», тот был на 700 млрд параметров), но выросла в коде, математике и агентных сценариях, а по ряду метрик обходит китайские DeepSeek V3.2 и свежий DeepSeek V4 Flash. Сбер подчёркивает, что весь стек — данные, архитектура, рецепт обучения и инфраструктура — сделан командой end-to-end, а детали реализации гейтов и стабилизации обучения раскрыты в статье на Habr.

432Bпараметров в модели
40%сокращение размера vs GigaChat 3.1 Ultra
68,7%win-rate против GPT-5 по оценке MiniMax-M2.7
  • Технические новшества: Gated Attention (модель локально приглушает избыточный сигнал внимания), GatedNorm (нормализация с явным гейтом для управления масштабом сигнала между признаками) — по данным Data Secrets, такую стабилизирующую оптимизацию Сбер выкладывает в опенсорс первым в мире
  • Линейный слой снижает KV-кеш на токен в 4 раза, позволяет поместить в ту же память в 2,14 раза больше контекста, throughput под нагрузкой растёт на +20%; добавлены две MTP-головыi, ускоряющие генерацию до 2,2 раза (по данным «Рестарт» — «до 4 раз» для длинных ответов)
  • Обучение полностью проведено в FP8i без потери качества относительно bf16 на собственных Triton- и CUDA-ядрах; после SFT и DPO добавлен новый этап online RL
  • По данным «Дизраптор» со ссылкой на статью на Habr: HumanEval вырос с 70% до 80%, SWE-Bench — с 8,6% до 42,6%; средний балл базовой модели — 72,3 против 71,5 у DeepSeek V3.2 и 71,9 у DeepSeek V4 Flash
  • Данные для обучения фильтровались собственной LLM-моделью из Common Crawl; число языков программирования в коде выросло с 16 (по данным NEURO-AI) до более чем 600
  • Выпущены версии GigaChat-3.5-Ultra-Base, -Instant (в источниках также встречается название -Instruct) — Instant/Instruct сопоставима с DeepSeek V3.2 при размере в 1,5 раза меньше
  • Критика от блогера «AI-Driven Development»: по его тестам агентности модель оказалась слабее GPT-OSS-120B; он предложил Сберу обновить линейку моделей на API, добавить дешёвый тариф для агентов и ускорить релизную политику к AI Journey в сентябре
Что дальше

Блогер «AI-Driven Development» призывает Сбер срочно обновить линейку моделей на API (нынешняя GigaChat 2 устарела), ввести дешёвый тариф для агентов и ускорить релизы, отмечая, что к AI Journey в сентябре конкуренты выпустят десяток новых моделей. «Дизраптор» указывает на возможный эффект «парадокса Джевонса»: удешевление инференса за счёт экономии памяти может резко увеличить масштаб использования модели в длинных агентных цепочках и RAG-сценариях.

Это произошло: Сбер открыл доступ к моделям GigaAM Multilingual и GigaChat Audio →

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖