← к ленте

Автоматизация создания видео-туториалов: локальный стек и лицензионные нюансы

A@qachanellавтор про «it»
2 нед

Опыт создания бесплатного локального пайплайна для генерации видео-туториалов: от синтеза речи с Google Chirp 3 HD и Chatterbox до автоматизации Puppeteer.

Как сократить расходы на производство видео-контента с помощью автоматизации.

  • Использование локальных инструментов и бесплатных тарифов позволяет создавать видео без затрат на подписки.
  • Автоматизация через Puppeteer позволяет переснимать ролики при изменении интерфейса одной командой.
  • Важно проверять лицензии моделей синтеза речи для коммерческого использования.
Еще вот таким балуюсь на досуге. Хочу автоматизировать создание роликов-туториалов для новой платформы stepimy.com не за все деньги мира, т.е. бесплатно, локально и относительно быстро. Готового сервиса нет, но есть два бесплатных куска, собранных вместе. Облачный диктор Google Chirp 3 HD читает мой текст: миллион знаков в месяц бесплатно, это примерно полторы тысячи роликов. Дальше Chatterbox под лицензией MIT перекрашивает чужой голос в похожий на мой. Ему нужны 20 секунд моей начитки как образец, и всё. Считает локально. Первое, обо что споткнулся при выборе, – это лицензии. Русских бесплатных голосов много, но ролик для платного сервиса, а это коммерческое использование. Silero и Piper ruslan – CC BY-NC, нельзя. У Piper irina права вообще не указаны, тоже мимо. Остались CC0-голоса Piper, MIT у Chatterbox и Chirp по бесплатному тарифу. Перед тем как брать голос, обязательно читайте лицензию корпуса, на котором он обучен. Второе: как понять, что синтез не сжевал слово. Готовую озвучку прогоняю через распознавание и сверяю со сценарием. Автотест на речь. И само собой слушаю сам. Три вещи, которые нашлись только замерами. 1. Теги пауз модель не понимает. Вместо тишины в записи слышно, как она читает тег вслух. 2. Знаки препинания дают разную тишину: запятая 0,15 секунды, тире 0,24, точка с запятой от 0,3 до 0,7, точка 1,25. Поэтому в тексте для голоса запятые заменены на точку с запятой, а на экране в субтитрах остались нормальные запятые. 3. Слово "хэшем" модель приняла за аббревиатуру и прочитала по буквам: "х-э-ш-е-м", полторы секунды вместо полусекунды. Лечится написанием через "е". Далее чтобы не искать только ухом, сборка сама ищет в распознавании подряд идущие однобуквенные "слова" и называет виновника. Картинку тоже никто не записывает руками. Сценарий ролика – это код: открыть страницу, навести курсор на кнопку "Создать доступ", нажать, подождать. Браузером управляет Puppeteer, клики настоящие, курсор дорисован прямо в странице, кадры снимаются с движка и потом собираются в видео. Поменялся интерфейс – ролик переснимается командой, а не заново записывается руками. Итого: бесплатно, локально, считайте безлимитно для моих задач. Да, не elevenlabs, но в этом случае и не надо.

Кратко (AI)

Автор делится опытом создания бесплатного локального инструмента для автоматизации видео-туториалов для платформы stepimy.com. Решение объединяет Google Chirp 3 HD для синтеза речи, Chatterbox для клонирования голоса и Puppeteer для записи действий в браузере. Особое внимание уделено юридической чистоте лицензий и техническим нюансам обработки текста для корректного звучания.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖