← к ленте

Google представила модель Gemini 3.5 Transcribe для распознавания речи

Н@GreenNeuralRobotsAI-инженер
2 дн

Google анонсировала Gemini 3.5 Transcribe — новую модель для распознавания речи с поддержкой форматирования, контекста и вызова функций.

Новая модель упрощает создание систем обработки голоса, объединяя несколько этапов анализа в один процесс.

  • Заменяет сложные цепочки из нескольких нейросетей на одно решение.
  • Автоматически улучшает качество транскрипции, убирая лишние звуки и ошибки речи.
  • Позволяет интегрировать голосовой ввод с другими ИИ-инструментами через вызов функций.
Gemini 3.5 Transcribe (Google) Новая модель распознавания речи от Google. В отличие от обычных ASR сразу чистит мусор, форматирует и понимает контекст - Умная транскрипция: убирает "эээ", "ммм", исправляет самоперебивы, автоматом форматирует - Распознавание более 85 языков с региональными акцентами, должен понимать русский - Определение до 3 спикеров в записи (3+ экспериментально) - Пользовательский словарь: специфические термины, коды, названия - Вызов функций: может делегировать сложные задачи вроде генерации картинок другим моделям Gemini - Стриминг: субсекундная задержка через Live API - Преемник Chirp 3 - значительный скачок по качеству - Замена традиционным ASR-пайплайнам: одна модель вместо конвейера из детекции, диарнализации и пост-обработки #ASR #STREAMING VK | MAX

Кратко (AI)

Google представила модель Gemini 3.5 Transcribe, предназначенную для качественного распознавания речи с автоматической очисткой текста от слов-паразитов и форматированием. Модель поддерживает более 85 языков, умеет определять спикеров и интегрируется с другими инструментами через вызов функций.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖