← к ленте

Google представила модели Gemini 3.5 Transcribe и Transcribe Live

М@cgeventAI-инженер
вчера

Google выпустила две новые модели для распознавания речи: Gemini 3.5 Transcribe и Transcribe Live с поддержкой 85+ языков и низкой стоимостью.

Google выпустила мощный инструмент для автоматической расшифровки аудио, который может стать стандартом для голосовых сервисов.

  • Модели обеспечивают высокую точность распознавания речи с поддержкой более 85 языков.
  • Функция Smart автоматически редактирует текст, удаляя слова-паразиты и повторы.
  • Низкая стоимость использования делает технологию доступной для массового внедрения в бизнес-приложения.
  • Поддержка потоковой передачи через WebSockets позволяет создавать быстрые голосовые агенты и субтитры в реальном времени.
Google выпустила Gemini 3.5 Transcribe и Transcribe Live Это две отдельные модели распознавания речи, уже в Gemini API. Обычная версия умеет в автоопределение среди 85+ языков, diarization спикеров, word-level timestamps и словарь до 1000 специальных терминов. Режим Smart сам вычищает «э-э», повторы и оговорки и превращает речь в нормально оформленный текст. Live работает потоково через WebSockets и рассчитан на голосовых агентов и субтитры в реальном времени. Google заявляет 5.04% WER на FLEURS для non-streaming и 5.50% для streaming, лучше Chirp 3. Цена очень гуманная: около $0.005 за минуту для обычной транскрибации и $0.009/мин для Live. Никаких весов, это вам не Виспер. https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/ https://ai.google.dev/gemini-api/docs/transcribe @cgevent
Google представила модели Gemini 3.5 Transcribe и Transcribe Live

Кратко (AI)

Google представила две новые модели для распознавания речи: Gemini 3.5 Transcribe и Transcribe Live. Они поддерживают более 85 языков, умеют очищать текст от слов-паразитов и работают через Gemini API, предлагая высокую точность и доступные цены.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖