Google представила Gemini 3.5 Transcribe — новую модель преобразования речи в текст, которую компания называет «самой точной». Модель не просто дословно расшифровывает аудио, а сразу редактирует результат: убирает слова-паразиты («э-э», «ммм»), исправляет оговорки и самоперебивы, автоматически форматирует текст с абзацами.
Вместе с обычной версией вышла Gemini 3.5 Transcribe Live — потоковая модель для голосовых агентов и субтитров в реальном времени с субсекундной задержкой. Обе модели доступны разработчикам через Gemini API и AI Studio, а также уже встроены в некоторые продукты Google.
85+поддерживаемых языков
5.04%WER на тесте FLEURS (non-streaming)
$0.005/минстоимость обычной транскрибации
- Модель поддерживает более 85 языков с региональными акцентами и диалектами, включая русский
- Различает до 3 говорящих в записи (диаризацияi 3+ — экспериментальная функция)
- Есть пользовательский словарь на до 1000 специфических терминов, кодов и названий
- Умеет вызывать функции и делегировать сложные задачи (например, генерацию картинок) другим моделям Gemini
- По заявлению Google, WERi (частота ошибок) на тесте FLEURS — 5,04% для обычной версии и 5,50% для потоковой Live, что лучше предыдущей модели Chirp 3
- Цена: около $0,005 за минуту обычной транскрибации и $0,009 за минуту для Live
- Модель уже используется в Gemini для macOS, приложении Rambler на Android и Gboard; в Chrome появится «скоро»
- По данным канала NEURO-AI, заявление «самая точная» справедливо только в сравнении с линейкой самой Google — у независимых замеров модель занимает лишь пятое место; там же указано ускорение расшифровки на 70% и возможность голосом править уже написанный текст
- В отличие от Whisper, веса модели не открыты
Google обещает добавить поддержку Gemini 3.5 Transcribe в Chrome, где голосом можно будет заполнять практически любые текстовые поля.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖