Google представила модели Gemini 3.5 Transcribe и Transcribe Live
М@cgeventAI-инженер
вчераGoogle выпустила две новые модели для распознавания речи: Gemini 3.5 Transcribe и Transcribe Live с поддержкой 85+ языков и низкой стоимостью.
Google выпустила мощный инструмент для автоматической расшифровки аудио, который может стать стандартом для голосовых сервисов.
- Модели обеспечивают высокую точность распознавания речи с поддержкой более 85 языков.
- Функция Smart автоматически редактирует текст, удаляя слова-паразиты и повторы.
- Низкая стоимость использования делает технологию доступной для массового внедрения в бизнес-приложения.
- Поддержка потоковой передачи через WebSockets позволяет создавать быстрые голосовые агенты и субтитры в реальном времени.
Google выпустила Gemini 3.5 Transcribe и Transcribe Live
Это две отдельные модели распознавания речи, уже в Gemini API.
Обычная версия умеет в автоопределение среди 85+ языков, diarization спикеров, word-level timestamps и словарь до 1000 специальных терминов.
Режим Smart сам вычищает «э-э», повторы и оговорки и превращает речь в нормально оформленный текст.
Live работает потоково через WebSockets и рассчитан на голосовых агентов и субтитры в реальном времени.
Google заявляет 5.04% WER на FLEURS для non-streaming и 5.50% для streaming, лучше Chirp 3.
Цена очень гуманная: около $0.005 за минуту для обычной транскрибации и $0.009/мин для Live.
Никаких весов, это вам не Виспер.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
https://ai.google.dev/gemini-api/docs/transcribe
@cgevent

Кратко (AI)
Google представила две новые модели для распознавания речи: Gemini 3.5 Transcribe и Transcribe Live. Они поддерживают более 85 языков, умеют очищать текст от слов-паразитов и работают через Gemini API, предлагая высокую точность и доступные цены.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖