← к ленте

Как улучшить качество речи в AI-видео: советы и лайфхаки

П@neural_proseccoмедиа / агрегатор
1 мес

Практические советы по улучшению качества речи в AI-видео: от промпт-инжиниринга до пост-обработки звука для достижения естественного звучания.

Самая большая проблема любого AI видео - речь 😬 Картинка в аи видосах уже почти неотличима от съемки даже для меня, а вот речь - все еще главный индикатор. По возможности я стараюсь генерировать войслес видео, но иногда тестирую концепты с говорящей головой или войсовером. Делюсь лайфхаками, которые я для себя нашла (работает и для text2speech, и для text2video) 1. Эмоция + действие + реплика - вместе 🥰 эмоции делают нас живыми, так что вместо "она говорит: привет", стоит прописать "она устало улыбается, отводит взгляд и тихо говорит: привет". Модель подстраивает мимику, темп и интонацию под описание. Тоновые слова (weary voice, shouts excitedly) пожалуй самый дешевый способ убрать робовойс. Можно прописать акцент, хрипоту, особенности 2. Короткие реплики и правильный синтаксис 😎 В Veo реплика идет после двоеточия, в Seedance - в двойных кавычках, лучше это заранее проверить в документациях разных моделей. Также если задаете длину видео, прикиньте что человек успеет все это сказать - иначе получится голосовое на 4х 3. Акустика и микс прямо в промпте 🚬 "в микрофоне слышен ветер, комната 10 кв метров", "громко говорит в огромном храме со сводами 20м в высоту" - модель может прикинуть пространство вокруг по тому, что видела в обучении. Seedance 2.0 делает видео и звук одним проходом, и ей можно задать приоритет слоев по громкости: dialogue clean and prominent, music low, ambient subtle, чтобы не было каши 4. Липсинк лучше работает на крупном плане 💄 Для говорящего персонажа лучше средний/крупный план, статичная камера, лицо анфас или в три четверти. На общем плане губам не хватает разрешения и они начинают жить своей жизнью 5. Пишите как говорят, а не как пишут 😁 Никаких коротких предложений, можно вставлять слова-паразиты и мычания, вдохи/выдохи, без сложной пунктуации, но вот троеточия и тире - отлично 6. Шепот - читерский прием 😳 В ElevenLabs v3 работают аудиотеги: [whispers], [sighs], [laughs], [clears throat]. "Another long day [sighs]" звучит как живой человек. А на шепоте почти не слышно артефактов синтеза - если голос палится, переведите сцену в шепот. Аудиотэги причем анализируются можно писать кастомные, также есть режим, где модель накидывает их на текст за вас 7. Пост-обработка • срезать 2-4 кГц (тот самый AI-звон) • room reverb 5-10% wet, добавляется акустика помещения • наложить фоновый шум в зависимости от бекгрануда на примерно -50 дБ, чтобы голос не звучал как в студии • войс морферы типа телефонный звонок, плохой микрофон (но с очень маленькой интенсивностью) Я бы сказала, что промпт надо писать как художественный текст с эпитетами, а не сухой алгоритм действий - будет сочнее и натуральнее. Постпроцессинг смотреть по ситуации, но базово - убирать полированность и де-идеализировать 🤣 пару примеров скину в комментарии @neural_prosecco

Кратко (AI)

Автор делится практическими советами по созданию реалистичной речи в AI-видео. Основные рекомендации включают детальное описание эмоций в промптах, использование аудиотегов для ElevenLabs v3, правильную настройку акустики и пост-обработку звука для устранения «роботизированности».

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖