Сбер открыл доступ к двум новым речевым моделям — мультиязычной системе распознавания речи GigaAM Multilinguali и audio-native LLM GigaChat Audioi. Обе модели строятся на аудиоэнкодере, обученном на 2 млн часов речи на 70+ языках с фокусом на страны СНГ, и решают две слабые стороны открытых Speech AI систем: плохую поддержку языков СНГ и деградацию качества на длинных записях.
GigaChat Audio объединяет GigaAM Multilingual и GigaChat3.1-10B-A1.8B и умеет работать с аудио напрямую — без промежуточной расшифровки в текст: ведёт диалог, переводит, классифицирует звук, считывает эмоции по интонации и находит нужные моменты в многочасовых записях с таймкодами. Обе научные статьи по моделям приняты на конференцию Interspeech 2026.
48.3точность локализации событий (IoU) на записях 20–60 мин
60.0 против 43.7балл RuBQ-Audio у GigaChat Audio vs Qwen3-Omni
240 млнпараметров компактной GigaAM Multilingual
- GigaAM Multilingual состоит из аудиоэнкодера с самообучением и многоязычной CTC ASR-модели; поддерживает русский, казахский, киргизский, узбекский и английский языки, компактная версия дообучена на 50 тыс. часов мультидоменной речи
- Компактная версия GigaAM Multilingual с 240 млн параметров обгоняет Whisper Large v3 и Omnilingual 1B, хотя весит кратно меньше
- На грузинском и башкирском (языки, не входящие в основной набор) модель дообучили на одном датасете Common Voice до WER ~4%, тогда как у Whisper Encoder при тех же условиях ошибка превышает 11%
- GigaChat Audio построена на GigaChat3.1-10B-A1.8B (10 млрд параметров, из них активных — 1,8 млрд), что позволяет запускать модель на собственном железе
- На записях длительностью 20–60 минут точность локализации событий (IoUi) у GigaChat Audio — 48.3, у конкурентов Voxtral, Phi-4 и Qwen3-Omni показатель близок к нулю
- Для обучения привязке событий ко времени опубликован датасет TimeGround-1M
- По данным источников 1, 4, 5, 6, 9, 10, 11 контекст GigaChat Audio — до 2 часов аудио; по данным источников 7 и 8 модель разбирает записи длиной до 3 часов
- Полноразмерная GigaChat-Max-Audio уже работает в ассистенте giga.chat и @gigachat_bot; распознавание голосовых на 5 языках доступно в боте @smartspeech_sber_bot
- Статьи по моделям опубликованы на arXiv (2607.10387 и 2607.10371) и приняты на конференцию Interspeech 2026
- Веса и код доступны на Hugging Face (ai-sage/GigaChat3.1-Audio-10B-A1.8B, ai-sage/GigaAM-Multilingual) и GitHub (salute-developers/GigaAM)
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖