6 июля 2026 года Сбер опубликовал в open source новую флагманскую LLM GigaChat 3.5 Ultra — модель на 432 млрд параметров под MIT-лицензией. Это первый в открытом доступе гибрид архитектур GatedDeltaNeti (линейное внимание) и MLA (классическое внимание), доведённый до масштаба сотен миллиардов параметров; рецепт обучения для него собирали в более чем 1500 экспериментах. Модель встроена в ИИ-помощника GigaChat, а веса выложены на HuggingFace и GitVerse.
При этом GigaChat 3.5 Ultra стала на 40% компактнее предыдущего флагмана GigaChat 3.1 Ultra (по данным «Рестарт», тот был на 700 млрд параметров), но выросла в коде, математике и агентных сценариях, а по ряду метрик обходит китайские DeepSeek V3.2 и свежий DeepSeek V4 Flash. Сбер подчёркивает, что весь стек — данные, архитектура, рецепт обучения и инфраструктура — сделан командой end-to-end, а детали реализации гейтов и стабилизации обучения раскрыты в статье на Habr.
- Технические новшества: Gated Attention (модель локально приглушает избыточный сигнал внимания), GatedNorm (нормализация с явным гейтом для управления масштабом сигнала между признаками) — по данным Data Secrets, такую стабилизирующую оптимизацию Сбер выкладывает в опенсорс первым в мире
- Линейный слой снижает KV-кеш на токен в 4 раза, позволяет поместить в ту же память в 2,14 раза больше контекста, throughput под нагрузкой растёт на +20%; добавлены две MTP-головыi, ускоряющие генерацию до 2,2 раза (по данным «Рестарт» — «до 4 раз» для длинных ответов)
- Обучение полностью проведено в FP8i без потери качества относительно bf16 на собственных Triton- и CUDA-ядрах; после SFT и DPO добавлен новый этап online RL
- По данным «Дизраптор» со ссылкой на статью на Habr: HumanEval вырос с 70% до 80%, SWE-Bench — с 8,6% до 42,6%; средний балл базовой модели — 72,3 против 71,5 у DeepSeek V3.2 и 71,9 у DeepSeek V4 Flash
- Данные для обучения фильтровались собственной LLM-моделью из Common Crawl; число языков программирования в коде выросло с 16 (по данным NEURO-AI) до более чем 600
- Выпущены версии GigaChat-3.5-Ultra-Base, -Instant (в источниках также встречается название -Instruct) — Instant/Instruct сопоставима с DeepSeek V3.2 при размере в 1,5 раза меньше
- Критика от блогера «AI-Driven Development»: по его тестам агентности модель оказалась слабее GPT-OSS-120B; он предложил Сберу обновить линейку моделей на API, добавить дешёвый тариф для агентов и ускорить релизную политику к AI Journey в сентябре
Блогер «AI-Driven Development» призывает Сбер срочно обновить линейку моделей на API (нынешняя GigaChat 2 устарела), ввести дешёвый тариф для агентов и ускорить релизы, отмечая, что к AI Journey в сентябре конкуренты выпустят десяток новых моделей. «Дизраптор» указывает на возможный эффект «парадокса Джевонса»: удешевление инференса за счёт экономии памяти может резко увеличить масштаб использования модели в длинных агентных цепочках и RAG-сценариях.
Это произошло: Сбер открыл доступ к моделям GigaAM Multilingual и GigaChat Audio →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖