Сбер представил модели GigaAM Multilingual и GigaChat Audio
N@notboring_techAI-инженер
1 месСбер открыл доступ к новым моделям распознавания речи GigaAM Multilingual и мультимодальной GigaChat Audio с поддержкой длинного контекста.
Сбер открыл доступ к новым моделям распознавания речи — GigaAM Multilingual и GigaChat Audio
GigaAM Multilingual включает два компонента. Аудиоэнкодер с самостоятельным обучением и многоязычную модель распознавания речи CTC ASR.
Аудиоэнкодер предварительно обучили на 2 млн часов речи на 70+ языках с фокусом на страны СНГ. Поэтому модель быстрее адаптируется к новым языкам и требует меньше данных для дообучения.
Многоязычную модель дообучили на 50 тысячах часов мультидоменной речи. Даже компактная версия с 240 млн параметров обгоняет популярные решения Whisper Large v3 и Omnilingual 1B.
Забирайте код и веса модели на Hugging Face и GitHub:
GigaAM Multilingual на Hugging Face
GigaAM Multilingual на GitHub
В свою очередь, GigaChat Audio — это большая языковая модель, которая объединяет возможности GigaAM Multilingual и GigaChat 3.1. Она распознаёт и переводит речь, классифицирует аудио и поддерживает диалог.
Её сильная сторона — работа с длинными записями. На аудио продолжительностью 20-60 минут показатель Intersection-over-Union локализации событий достигает 48.3. При этом объём контекста составляет до двух часов.
Кроме того, GigaChat Audio хорошо понимает русскую речь: 60.0 балла в бенчмарке RuBQ-Audio против 43.7 у Qwen3-Omni. А ещё распознаёт эмоции с точностью 90%+ по датасету Dusha.
Забирайте код и веса модели на Hugging Face:
GigaChat Audio на Hugging Face
@notboring_tech
Кратко (AI)
Сбер выпустил новые модели для работы с аудио: GigaAM Multilingual для распознавания речи и GigaChat Audio, объединяющую возможности распознавания и языковую модель GigaChat 3.1. Новинки показывают высокую эффективность в работе с длинными записями и превосходят ряд аналогов в бенчмарках.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖