Как улучшить качество речи в AI-видео: советы и лайфхаки
П@neural_proseccoмедиа / агрегатор
1 месПрактические советы по улучшению качества речи в AI-видео: от промпт-инжиниринга до пост-обработки звука для достижения естественного звучания.
Самая большая проблема любого AI видео - речь 😬
Картинка в аи видосах уже почти неотличима от съемки даже для меня, а вот речь - все еще главный индикатор. По возможности я стараюсь генерировать войслес видео, но иногда тестирую концепты с говорящей головой или войсовером. Делюсь лайфхаками, которые я для себя нашла (работает и для text2speech, и для text2video)
1. Эмоция + действие + реплика - вместе 🥰
эмоции делают нас живыми, так что вместо "она говорит: привет", стоит прописать "она устало улыбается, отводит взгляд и тихо говорит: привет". Модель подстраивает мимику, темп и интонацию под описание. Тоновые слова (weary voice, shouts excitedly) пожалуй самый дешевый способ убрать робовойс. Можно прописать акцент, хрипоту, особенности
2. Короткие реплики и правильный синтаксис 😎
В Veo реплика идет после двоеточия, в Seedance - в двойных кавычках, лучше это заранее проверить в документациях разных моделей. Также если задаете длину видео, прикиньте что человек успеет все это сказать - иначе получится голосовое на 4х
3. Акустика и микс прямо в промпте 🚬
"в микрофоне слышен ветер, комната 10 кв метров", "громко говорит в огромном храме со сводами 20м в высоту" - модель может прикинуть пространство вокруг по тому, что видела в обучении. Seedance 2.0 делает видео и звук одним проходом, и ей можно задать приоритет слоев по громкости: dialogue clean and prominent, music low, ambient subtle, чтобы не было каши
4. Липсинк лучше работает на крупном плане 💄
Для говорящего персонажа лучше средний/крупный план, статичная камера, лицо анфас или в три четверти. На общем плане губам не хватает разрешения и они начинают жить своей жизнью
5. Пишите как говорят, а не как пишут 😁
Никаких коротких предложений, можно вставлять слова-паразиты и мычания, вдохи/выдохи, без сложной пунктуации, но вот троеточия и тире - отлично
6. Шепот - читерский прием 😳
В ElevenLabs v3 работают аудиотеги: [whispers], [sighs], [laughs], [clears throat]. "Another long day [sighs]" звучит как живой человек. А на шепоте почти не слышно артефактов синтеза - если голос палится, переведите сцену в шепот. Аудиотэги причем анализируются можно писать кастомные, также есть режим, где модель накидывает их на текст за вас
7. Пост-обработка
• срезать 2-4 кГц (тот самый AI-звон)
• room reverb 5-10% wet, добавляется акустика помещения
• наложить фоновый шум в зависимости от бекгрануда на примерно -50 дБ, чтобы голос не звучал как в студии
• войс морферы типа телефонный звонок, плохой микрофон (но с очень маленькой интенсивностью)
Я бы сказала, что промпт надо писать как художественный текст с эпитетами, а не сухой алгоритм действий - будет сочнее и натуральнее. Постпроцессинг смотреть по ситуации, но базово - убирать полированность и де-идеализировать 🤣
пару примеров скину в комментарии
@neural_prosecco
Кратко (AI)
Автор делится практическими советами по созданию реалистичной речи в AI-видео. Основные рекомендации включают детальное описание эмоций в промптах, использование аудиотегов для ElevenLabs v3, правильную настройку акустики и пост-обработку звука для устранения «роботизированности».
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖