Про диктовку голосом
Потихоньку переучиваюсь наговаривать текст голосом, а не печатать на клавиатуре.
Когда печатаешь, проще структурировать мысли и рассуждать. Но для мозга это сложнее и дольше. Это цена которую ты платишь за возможность получше подумать.
Ну и иногда мозг ленится платить слишком много. Я заметил, что когда наговариваю нейронке голосом, я больше деталей описываю. И бонусом, это еще и в разы быстрее выходит.
Поресёрчил чем лучше всего пользоваться и остановился на
https://spokenly.app + gpt-4o-mini-transcribe.
Большинство продуктов на рынке - это обертки над какой то из speech-to-text моделей. Обычно над чем то из этого:
Deepgram Nova‑3
ElevenLabs Scribe v2
GPT‑4o‑transcribe
NVIDIA Parakeet TDT
Whisper large‑v3
Стоят примерно одинаково дёшево, а последние 2 можно вообще за бесплатно локально на своем железе использовать. Вот
тут всякие бенчмарки на точность и скорость.
Deepgram лучше всего с ру языком ладит, ElevenLabs с английским. Хотя по факту для личных задач разброс точности в 2-5% особо погоды не делает.
И я пока честно не понимаю, зачем платить 12 баксов в месяц за обёртку Wispr Flow. Это сейчас самый популярный dictation апп, с оценкой компании в 2 миллиарда долларов.
А Spokenly делает соло разработчик. И у меня при активном использовании через API меньше 1 доллара в месяц уходит.