Тест-драйв аудиомодели GigaChat Audio в рабочих задачах




Сбер открыл доступ к двум новым речевым моделям — мультиязычной системе распознавания речи GigaAM Multilinguali и audio-native LLM GigaChat Audioi. Обе модели строятся на аудиоэнкодере, обученном на 2 млн часов речи на 70+ языках с фокусом на страны СНГ, и решают две слабые стороны открытых Speech AI систем: плохую поддержку языков СНГ и деградацию качества на длинных записях.
GigaChat Audio объединяет GigaAM Multilingual и GigaChat3.1-10B-A1.8B и умеет работать с аудио напрямую — без промежуточной расшифровки в текст: ведёт диалог, переводит, классифицирует звук, считывает эмоции по интонации и находит нужные моменты в многочасовых записях с таймкодами. Обе научные статьи по моделям приняты на конференцию Interspeech 2026.
6 июля 2026 года Сбер опубликовал в open source новую флагманскую LLM GigaChat 3.5 Ultra — модель на 432 млрд параметров под MIT-лицензией. Это первый в открытом доступе гибрид архитектур GatedDeltaNeti (линейное внимание) и MLA (классическое внимание), доведённый до масштаба сотен миллиардов параметров; рецепт обучения для него собирали в более чем 1500 экспериментах. Модель встроена в ИИ-помощника GigaChat, а веса выложены на HuggingFace и GitVerse.
При этом GigaChat 3.5 Ultra стала на 40% компактнее предыдущего флагмана GigaChat 3.1 Ultra (по данным «Рестарт», тот был на 700 млрд параметров), но выросла в коде, математике и агентных сценариях, а по ряду метрик обходит китайские DeepSeek V3.2 и свежий DeepSeek V4 Flash. Сбер подчёркивает, что весь стек — данные, архитектура, рецепт обучения и инфраструктура — сделан командой end-to-end, а детали реализации гейтов и стабилизации обучения раскрыты в статье на Habr.