Релиз аудио-модели GigaChat3.1-Audio-10B-A1.8B
Н@GreenNeuralRobotsAI-инженер
1 месОбзор возможностей новой аудио-LLM GigaChat3.1-Audio-10B-A1.8B: распознавание речи, перевод, QA и временная привязка событий в длинных записях.
Новая модель позволяет эффективно анализировать многочасовые аудиозаписи, автоматически извлекая из них смысл и конкретные факты.
- Автоматизация расшифровки и анализа длинных встреч или лекций.
- Возможность быстрого поиска конкретных моментов в аудио по текстовому запросу.
- Поддержка русского и английского языков расширяет возможности применения в бизнесе.
GigaChat3.1-Audio-10B-A1.8B
Аудио LLM для работы с длинными записями (2 часа)
* Распознавание речи (ASR) - переводит аудио в текст
* Перевод - упомянуты русский и английский
* Ответы на вопросы по аудио (QA)
* Распознавание эмоций
* Временная привязка (temporal grounding). находит в какой части аудио происходит то или иное событие. заявлено 48.3 mIoU на задачах для записей до 2 часов
• 10B #MoE декодер, активно 1.8B параметров
• энкодер GigaAM
Демо
#alm #qa #asr #stt #translation #russian
Кратко (AI)
Представлена новая аудио-LLM GigaChat3.1-Audio-10B-A1.8B, предназначенная для обработки длинных аудиозаписей до 2 часов. Модель поддерживает распознавание речи, перевод, ответы на вопросы и временную привязку событий, используя архитектуру MoE с 1.8B активных параметров.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖