← к ленте

Latent-to-4D: генерация 4D-сцен напрямую из латентного пространства

Н@GreenNeuralRobotsAI-инженер
2 нед

Новый метод генерации динамических 4D-сцен из текста, изображений и аудио без промежуточного RGB-декодинга, используя латентное пространство видео-DiT.

Технология ускоряет создание 3D-анимации, позволяя генерировать сложные сцены с движением напрямую из нейросетевых представлений.

  • Исключение RGB-декодинга повышает эффективность генерации 4D-контента.
  • Поддержка различных входных данных (текст, аудио, видео) расширяет возможности для аниматоров и разработчиков.
  • Возможность использования в робототехнике для симуляции манипуляций.
Latent-to-4D Генерация динамических 4D-сцен из текста и картинок без промежуточного RGB-декодинга. Вместо RGB-декодинга берет финальный латент видео-DiT и поднимает его сразу в явную 4D-сцену На выходе камеры и динамические карты точек в мировых координатах. • Text-to-4D - сцена из текста, 81 кадр с камерами и динамической геометрией • Image-to-4D - первый кадр задаёт внешний вид и композицию • Audio-driven 4D - аудио управляет лицом, телом и камерой • Video-as-prompt 4D - перенос стиля/трансформации из демо-видео • Pose-controlled и motion-controlled анимация - скелет или траектории точек ведут движение • 4D-симуляция для робоманипуляций Гитхаб ждем #textto4d #imageto4d #4d
Latent-to-4D: генерация 4D-сцен напрямую из латентного пространства

Кратко (AI)

Представлен метод Latent-to-4D, позволяющий создавать динамические 4D-сцены напрямую из латентного представления видео-моделей типа DiT, минуя стадию RGB-декодинга. Технология поддерживает генерацию из текста, изображений, аудио, а также управление движением через позы и траектории, что может быть полезно для робототехники.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖