Исследователи из Zhejiang University, Robbyant, Ant Group и HKUST представили открытый фреймворк 4DAnyone, который строит объёмную 4D-модель движущегося человека по обычному видео с одной камеры — без рига, калибровки и штатива. Раньше для такой реконструкции требовалась студия с десятками синхронных камер.
Фреймворк генерирует 16 согласованных между собой ракурсов, которых камера не снимала, и собирает их в сцену формата 4D Gaussian Splattingi — объёмное представление, меняющееся во времени. Готовую модель можно осматривать с любой точки в VR, вставлять в игры, AR-сцены или использовать как обучающие данные для роботов.
16сгенерированных согласованных ракурсов
24.15 PSNRкачество реконструкции на DNA-Rendering
40ключевых точек скелета
- В основе — видеодиффузионный трансформер Wan2.2-TI2V-5Bi (по данным Neurohive) с VAE и энкодером umt5-xxl (по данным Нейронавта), дообученный генерировать новые ракурсы человека по 3D-скелету с сохранением внешности из исходного видео
- Скелетное условие содержит 40 ключевых точек: 17 на теле, 6 на стопах, 10 на ладонях и 7 вспомогательных; детальная разметка лица и пальцев отброшена как неточная — мимику и форму кистей модель берёт напрямую из видео
- Reference Context Packing сжимает растущий референсный контекст в фиксированный бюджет, а Target Context Routing обменивается информацией между группами ракурсов, устраняя структурный дрейф
- Детекция человека и позы выполняется через YOLO, ViTPose и GVHMR; ускорение инференса — через FlashAttention-3 или SageAttention
- По качеству реконструкции 4DAnyone превосходит все сравниваемые методы: 24.15 PSNRi против 20.55 у ближайшего конкурента на датасете DNA-Rendering и 23.28 против 19.86 на DyMVHumans
- Наилучшие результаты достигаются при одном человеке в кадре, спокойном движении камеры и облегающей одежде
- Проект открытый: код опубликован на GitHub, веса модели — на Hugging Face
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖