← к ленте

Команда GigaChat выпустила аудио-модели и датасет в открытый доступ

1 мес

Команда GigaChat представила аудио-модели GigaChat3.1-Audio-10B-A1.8B и GigaAM-Multilingual, а также датасет TimeGround-1M для анализа речи.

Модели для распознавания и анализа речи — в открытом доступе Команда GigaChat выложила две модели и датасет: — GigaChat3.1-Audio-10B-A1.8B - audio-native LLM — GigaAM-Multilingual - мультиязычный ASR — TimeGround-1M - датасет для привязки событий ко времени в длинном аудио GigaChat Audio работает со звуком напрямую, без промежуточной расшифровки в текст. Ведёт диалог по записи, распознаёт речь, переводит, классифицирует и собирает выжимку с таймкодами. Держит до двух часов аудио — то есть созвон или лекцию целиком, без нарезки на куски. Загрузил запись — получил резюме и таймкоды, чтобы перемотать к нужному месту. Сильная сторона как раз в этом: модель понимает не только что сказали, но и когда. GigaAM-Multilingual — распознавание речи на русском, английском, казахском, киргизском и узбекском. Энкодер предобучен на 2 млн часов и 70+ языках, так что под новый язык или домен дообучается на скромных данных: грузинский и башкирский подняли с одного Common Voice до WER ~4%. TimeGround-1M — это данные, а не веса. Веса сейчас открывают многие, датасеты — заметно реже, а здесь можно учить собственные модели привязывать события ко времени. Что можно собрать уже сейчас: — ассистент по встречам и лекциям — поиск по аудиозаписям — выжимки с таймкодами — ASR для ботов и приложений — дообучение под свой язык и домен У Audio-модели 10B параметров, активных — 1,8B, так что поднять её реально на своём железе. Обе статьи приняли на Interspeech 2026. Hugging Face: — https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8Bhttps://huggingface.co/ai-sage/GigaAM-Multilingualhttps://huggingface.co/datasets/ai-sage/TimeGround-1M С удовольствием посмотрел статьи команды: https://arxiv.org/abs/2607.10387 https://arxiv.org/abs/2607.10371

Кратко (AI)

Команда GigaChat опубликовала две новые модели для работы с аудио: аудио-нативную LLM GigaChat3.1-Audio-10B-A1.8B и мультиязычную систему распознавания речи GigaAM-Multilingual. Также был открыт датасет TimeGround-1M, предназначенный для обучения моделей привязке событий к таймкодам в длинных аудиозаписях.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖