Команда GigaChat выпустила аудио-модели и датасет в открытый доступ
M@machinelearning_interviewAI-инженер
1 месКоманда GigaChat представила аудио-модели GigaChat3.1-Audio-10B-A1.8B и GigaAM-Multilingual, а также датасет TimeGround-1M для анализа речи.
Модели для распознавания и анализа речи — в открытом доступе
Команда GigaChat выложила две модели и датасет:
— GigaChat3.1-Audio-10B-A1.8B - audio-native LLM
— GigaAM-Multilingual - мультиязычный ASR
— TimeGround-1M - датасет для привязки событий ко времени в длинном аудио
GigaChat Audio работает со звуком напрямую, без промежуточной расшифровки в текст. Ведёт диалог по записи, распознаёт речь, переводит, классифицирует и собирает выжимку с таймкодами. Держит до двух часов аудио — то есть созвон или лекцию целиком, без нарезки на куски.
Загрузил запись — получил резюме и таймкоды, чтобы перемотать к нужному месту. Сильная сторона как раз в этом: модель понимает не только что сказали, но и когда.
GigaAM-Multilingual — распознавание речи на русском, английском, казахском, киргизском и узбекском.
Энкодер предобучен на 2 млн часов и 70+ языках, так что под новый язык или домен дообучается на скромных данных: грузинский и башкирский подняли с одного Common Voice до WER ~4%.
TimeGround-1M — это данные, а не веса. Веса сейчас открывают многие, датасеты — заметно реже, а здесь можно учить собственные модели привязывать события ко времени.
Что можно собрать уже сейчас:
— ассистент по встречам и лекциям
— поиск по аудиозаписям
— выжимки с таймкодами
— ASR для ботов и приложений
— дообучение под свой язык и домен
У Audio-модели 10B параметров, активных — 1,8B, так что поднять её реально на своём железе. Обе статьи приняли на Interspeech 2026.
Hugging Face:
— https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B
— https://huggingface.co/ai-sage/GigaAM-Multilingual
— https://huggingface.co/datasets/ai-sage/TimeGround-1M
С удовольствием посмотрел статьи команды:
https://arxiv.org/abs/2607.10387
https://arxiv.org/abs/2607.10371
Кратко (AI)
Команда GigaChat опубликовала две новые модели для работы с аудио: аудио-нативную LLM GigaChat3.1-Audio-10B-A1.8B и мультиязычную систему распознавания речи GigaAM-Multilingual. Также был открыт датасет TimeGround-1M, предназначенный для обучения моделей привязке событий к таймкодам в длинных аудиозаписях.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖