Сбер выпустил GigaAM Multilingual и GigaChat Audio в опенсорс
М@cgeventAI-инженер
1 месСбер представил открытые модели GigaAM Multilingual и GigaChat Audio, ориентированные на работу с длинным аудиоконтекстом и редкими языками.
Давно наблюдаю за речевыми моделями Сбера, и сейчас они выкатили действительно полезные штуки в опенсорс. Опубликовали веса GigaAM Multilingual и полноценной audio-native модели GigaChat Audio. Статьи по ним уже приняли на Interspeech 2026, что само по себе хороший маркер.
Здесь примечательно, как разработчики заходят на территорию длинных аудиоконтекстов и редких языков, где открытый софт обычно чувствует себя неуверенно:
GigaAM Multilingual — стек для распознавания русского, казахского, киргизского, узбекского и английского. Базовый аудиоэнкодер обучали на 2 млн часов речи, поэтому он быстро адаптируется к новым доменам. На башкирском и грузинском его дообучили с одного датасета до ошибки WER ~4% (у Whisper Encoder там больше 11%), а компактная модель CTC ASR на 240M параметров обходит Whisper Large v3 и Omnilingual 1B;
GigaChat Audio — полноценная audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Модель держит до 2 часов контекста и умеет в temporal grounding, то есть находит конкретные события на длинной записи и делает выжимку с таймстемпами. На записях от 20 до 60 минут точность локализации событий у нее составляет 48.3, в то время как у зарубежных Voxtral, Phi-4 и Qwen3-Omni показатели близки к нулю.
Вдобавок опубликовали датасет TimeGround-1M для обучения LLM привязке событий ко времени, а на бенчмарке RuBQ-Audio модель выбивает 60.0 (против 43.7 у Qwen3-Omni).
Ощущение, что со звуком происходит ровно то же, что в свое время с текстом. Модели учатся не просто расшифровывать слова в поток букв, а реально анализировать услышанное: вычленять суть, понимать контекст и тайминг. Для разбора многочасовых созвонов или лекций — инструмент незаменимый.
Полноразмерную GigaChat-Max-Audio уже добавили на giga.chat, а распознавание голосовых сообщений на 5 языках работает в @smartspeech_sber_bot. Веса открытых моделей, датасет и статьи на arXiv уже доступны.
@cgevent
Кратко (AI)
Сбер опубликовал в открытом доступе модели GigaAM Multilingual для распознавания речи и audio-native LLM GigaChat Audio. Новые модели показывают высокую эффективность в работе с редкими языками и длинным аудиоконтекстом, превосходя зарубежные аналоги в задачах локализации событий и точности распознавания.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖