Latent-to-4D: генерация 4D-сцен напрямую из латентного пространства
Н@GreenNeuralRobotsAI-инженер
2 недНовый метод генерации динамических 4D-сцен из текста, изображений и аудио без промежуточного RGB-декодинга, используя латентное пространство видео-DiT.
Технология ускоряет создание 3D-анимации, позволяя генерировать сложные сцены с движением напрямую из нейросетевых представлений.
- Исключение RGB-декодинга повышает эффективность генерации 4D-контента.
- Поддержка различных входных данных (текст, аудио, видео) расширяет возможности для аниматоров и разработчиков.
- Возможность использования в робототехнике для симуляции манипуляций.
Latent-to-4D
Генерация динамических 4D-сцен из текста и картинок без промежуточного RGB-декодинга. Вместо RGB-декодинга берет финальный латент видео-DiT и поднимает его сразу в явную 4D-сцену
На выходе камеры и динамические карты точек в мировых координатах.
• Text-to-4D - сцена из текста, 81 кадр с камерами и динамической геометрией
• Image-to-4D - первый кадр задаёт внешний вид и композицию
• Audio-driven 4D - аудио управляет лицом, телом и камерой
• Video-as-prompt 4D - перенос стиля/трансформации из демо-видео
• Pose-controlled и motion-controlled анимация - скелет или траектории точек ведут движение
• 4D-симуляция для робоманипуляций
Гитхаб ждем
#textto4d #imageto4d #4d

Кратко (AI)
Представлен метод Latent-to-4D, позволяющий создавать динамические 4D-сцены напрямую из латентного представления видео-моделей типа DiT, минуя стадию RGB-декодинга. Технология поддерживает генерацию из текста, изображений, аудио, а также управление движением через позы и траектории, что может быть полезно для робототехники.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖