← к ленте

Сбер выпустил GigaAM Multilingual и GigaChat Audio в опенсорс

М@cgeventAI-инженер
1 мес

Сбер представил открытые модели GigaAM Multilingual и GigaChat Audio, ориентированные на работу с длинным аудиоконтекстом и редкими языками.

Давно наблюдаю за речевыми моделями Сбера, и сейчас они выкатили действительно полезные штуки в опенсорс. Опубликовали веса GigaAM Multilingual и полноценной audio-native модели GigaChat Audio. Статьи по ним уже приняли на Interspeech 2026, что само по себе хороший маркер. Здесь примечательно, как разработчики заходят на территорию длинных аудиоконтекстов и редких языков, где открытый софт обычно чувствует себя неуверенно: GigaAM Multilingual — стек для распознавания русского, казахского, киргизского, узбекского и английского. Базовый аудиоэнкодер обучали на 2 млн часов речи, поэтому он быстро адаптируется к новым доменам. На башкирском и грузинском его дообучили с одного датасета до ошибки WER ~4% (у Whisper Encoder там больше 11%), а компактная модель CTC ASR на 240M параметров обходит Whisper Large v3 и Omnilingual 1B; GigaChat Audio — полноценная audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Модель держит до 2 часов контекста и умеет в temporal grounding, то есть находит конкретные события на длинной записи и делает выжимку с таймстемпами. На записях от 20 до 60 минут точность локализации событий у нее составляет 48.3, в то время как у зарубежных Voxtral, Phi-4 и Qwen3-Omni показатели близки к нулю. Вдобавок опубликовали датасет TimeGround-1M для обучения LLM привязке событий ко времени, а на бенчмарке RuBQ-Audio модель выбивает 60.0 (против 43.7 у Qwen3-Omni). Ощущение, что со звуком происходит ровно то же, что в свое время с текстом. Модели учатся не просто расшифровывать слова в поток букв, а реально анализировать услышанное: вычленять суть, понимать контекст и тайминг. Для разбора многочасовых созвонов или лекций — инструмент незаменимый. Полноразмерную GigaChat-Max-Audio уже добавили на giga.chat, а распознавание голосовых сообщений на 5 языках работает в @smartspeech_sber_bot. Веса открытых моделей, датасет и статьи на arXiv уже доступны. @cgevent

Кратко (AI)

Сбер опубликовал в открытом доступе модели GigaAM Multilingual для распознавания речи и audio-native LLM GigaChat Audio. Новые модели показывают высокую эффективность в работе с редкими языками и длинным аудиоконтекстом, превосходя зарубежные аналоги в задачах локализации событий и точности распознавания.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖