Sber AI выложил в открытый доступ аудио-модели GigaChat Audio и GigaAM Multilingual, принятые на конференцию Interspeech 2026.
🚫
СТОЙТЕ, ГИГАЧАТ ХОЧЕТ ОТВЕТИТЬ
Мы выложили в Open Source сразу две модели для работы со звуком: audio-native LLM
GigaChat Audio и мультиязычное SOTA-распознавание речи
GigaAM Multilingual. Обе работы приняты на
Interspeech 2026 — главную мировую конференцию по речевым технологиям 🔥
Чем силён GigaChat Audio?
🤩 Понимает длинные записи
Держит контекст до 2 часов аудио и свободно ориентируется внутри: находит момент, где обсуждали нужную тему, пересказывает фрагмент, собирает саммари с таймкодами. На записях 20–60 минут точность локализации событий — 48.3 IoU против ~0 у Voxtral, Phi-4 и Qwen3-Omni
🤩 Считывает эмоции
По интонации и манере речи распознаёт настроение говорящего — 90%+ на бенчмарке Dusha — и учитывает его в ответе
🤩 Распознаёт русский на слух лучше аналогов
RuBQ-Audio: 60,0 против 43,7 у Qwen3-Omni. А ещё — multi-turn диалог, перевод, классификация аудио и распознавание речи в одной модели
GigaAM Multilingual —
расширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский. Компактная версия на 240M параметров обгоняет Whisper Large v3 и Omnilingual 1B, а аудиоэнкодер, предобученный на 2 млн часов речи на 70+ языках, адаптируется к новым языкам с минимумом данных: на грузинском и башкирском хватило одного Common Voice, чтобы дойти до WER ~4% против 11%+ у Whisper
Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям
Interspeech 2026
Модели уже работают в
ГигаЧате: общайтесь голосом, присылайте голосовые сообщения и аудиофайлы.
Разработчикам предлагаем забрать GigaChat Audio и GigaAM Multilingual в Open Source вместе с датасетом TimeGround-1M
А если интересна техническая часть, читайте
пост команды ↖️
✔️ Подписывайтесь на Sber AI в МАКС
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖