Google представила модель Gemini 3.5 Transcribe для распознавания речи
Н@GreenNeuralRobotsAI-инженер
2 днGoogle анонсировала Gemini 3.5 Transcribe — новую модель для распознавания речи с поддержкой форматирования, контекста и вызова функций.
Новая модель упрощает создание систем обработки голоса, объединяя несколько этапов анализа в один процесс.
- Заменяет сложные цепочки из нескольких нейросетей на одно решение.
- Автоматически улучшает качество транскрипции, убирая лишние звуки и ошибки речи.
- Позволяет интегрировать голосовой ввод с другими ИИ-инструментами через вызов функций.
Gemini 3.5 Transcribe (Google)
Новая модель распознавания речи от Google. В отличие от обычных ASR сразу чистит мусор, форматирует и понимает контекст
- Умная транскрипция: убирает "эээ", "ммм", исправляет самоперебивы, автоматом форматирует
- Распознавание более 85 языков с региональными акцентами, должен понимать русский
- Определение до 3 спикеров в записи (3+ экспериментально)
- Пользовательский словарь: специфические термины, коды, названия
- Вызов функций: может делегировать сложные задачи вроде генерации картинок другим моделям Gemini
- Стриминг: субсекундная задержка через Live API
- Преемник Chirp 3 - значительный скачок по качеству
- Замена традиционным ASR-пайплайнам: одна модель вместо конвейера из детекции, диарнализации и пост-обработки
#ASR #STREAMING
VK | MAX
Кратко (AI)
Google представила модель Gemini 3.5 Transcribe, предназначенную для качественного распознавания речи с автоматической очисткой текста от слов-паразитов и форматированием. Модель поддерживает более 85 языков, умеет определять спикеров и интегрируется с другими инструментами через вызов функций.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖