Эволюция инструментов генерации видео: от промптов к режиссерскому контролю
М@cgeventAI-инженер
1 месАвтор анализирует развитие нейросетевых пайплайнов для видео, подчеркивая переход от текстовых промптов к профессиональным методам управления камерой и анимацией.
Режиссерский софт
Перейдем от робатов к делам насущным. Поднял архивы постов и нашел, что больше трех лет назад писал:
"Интересно будет посмотреть на трушные нейропайплайны, когда chatGPT наговаривает промпты, по ним генерятся картинки для раскадровок, chatGPT дополняет это динамикой переходов, одновременно подгружаются видео-референсы со стоков, из которых достается движение камеры и оптики, по дороге пристегивается controlNet с персонажами, и весь этот компот идет на вход compot2Video."
https://t.me/cgevent/5165
Хех, и что мы видим в твитторах сегодня? Накаркал.
Тогда же в 2023 году писал:
"А к тому, что с видео и с анимацией все не так сладко, как с картинками. И на входе генерации видео будет тонна "гайдов" и референсов, а не только текст и кнопка "Генерить шедевр".
И эти гайды будут наследоваться из традиционных пайплайнов. Концепты и даже раскадровки можно генерить, а вот описывать движение камеры, персонажа, света, оптики словами - ну такое..."
https://t.me/cgevent/5281
Еще я упорно ныл, что видео - оно само по себе сложное. Там не просто пиксели бегают по картинке, там шевелятся десятки сущностей: персонажи, фоны, освещение, тени, фокусное расстояние, текстуры и еще много всего. Разметить картинку и разметить видео - немного разные задачи. Описать движение? Попробуйте сами двух словах. Промпты должны быть величиной с дом для попадания в замысел сам себе режиссера.
https://t.me/cgevent/7315
Это как бы затравка для небольшого марафона по тем инструментам, которые генеративная братия изобретает прямо сейчас, ибо с приходом Сиданского до всех наконец-то дошло, что видео словами не опишешь и нужны новые способы управления камерой, анимацией, светом, оптикой и что-там еще есть в этом бесовском видео.
Одно из решений - блокинг. Или превиз. Поэтому я так много постил за нейрорендер. Болваны в блендоре - рендер в Сиденском.
Теперь пошла новая волна - сохранение консистентности и стилей через глубину (видео идет путем контролнета).
И уже пошли софты типа LTX Director.
Об этом и поговорим.
@cgevent
КонтекстAI
Автор ссылается на свои прошлые прогнозы (2023 год) относительно сложности генерации видео по сравнению с изображениями. Упоминание 'Сиданского' относится к модели Stable Video Diffusion или аналогичным генеративным видео-моделям, требующим глубокого контроля над параметрами сцены.
Кратко (AI)
Автор рассуждает о том, как генерация видео переходит от простых текстовых запросов к сложным пайплайнам, требующим режиссерского контроля. Он отмечает, что для качественного результата необходимы инструменты управления камерой, светом и анимацией, подобные тем, что используются в традиционном превизе. В качестве примера новых решений упоминается LTX Director.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖