← к ленте

Опыт перехода на голосовой ввод текста и обзор инструментов

Т@CommonsTragedyавтор про «it»
вчера

Автор делится опытом использования голосового ввода вместо печати, сравнивает популярные speech-to-text модели и критикует стоимость подписок на диктовку.

Голосовой ввод становится эффективным инструментом для работы с текстом благодаря развитию нейросетевых моделей.

  • Использование API для диктовки может быть значительно дешевле готовых платных приложений.
  • Разные модели (Deepgram, ElevenLabs, Whisper) имеют свои преимущества в зависимости от языка.
  • Голосовой ввод позволяет быстрее фиксировать мысли, хотя требует адаптации стиля мышления.
Про диктовку голосом Потихоньку переучиваюсь наговаривать текст голосом, а не печатать на клавиатуре. Когда печатаешь, проще структурировать мысли и рассуждать. Но для мозга это сложнее и дольше. Это цена которую ты платишь за возможность получше подумать. Ну и иногда мозг ленится платить слишком много. Я заметил, что когда наговариваю нейронке голосом, я больше деталей описываю. И бонусом, это еще и в разы быстрее выходит. Поресёрчил чем лучше всего пользоваться и остановился на https://spokenly.app + gpt-4o-mini-transcribe. Большинство продуктов на рынке - это обертки над какой то из speech-to-text моделей. Обычно над чем то из этого: Deepgram Nova‑3 ElevenLabs Scribe v2 GPT‑4o‑transcribe NVIDIA Parakeet TDT Whisper large‑v3 Стоят примерно одинаково дёшево, а последние 2 можно вообще за бесплатно локально на своем железе использовать. Вот тут всякие бенчмарки на точность и скорость. Deepgram лучше всего с ру языком ладит, ElevenLabs с английским. Хотя по факту для личных задач разброс точности в 2-5% особо погоды не делает. И я пока честно не понимаю, зачем платить 12 баксов в месяц за обёртку Wispr Flow. Это сейчас самый популярный dictation апп, с оценкой компании в 2 миллиарда долларов. А Spokenly делает соло разработчик. И у меня при активном использовании через API меньше 1 доллара в месяц уходит.

Кратко (AI)

Автор рассуждает о преимуществах голосового ввода текста перед набором на клавиатуре, отмечая рост скорости и детализации мыслей. Он сравнивает различные speech-to-text модели и критикует высокую стоимость популярных приложений-оберток, предлагая более дешевые альтернативы.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖