4DAnyone: создание 4D-моделей человека из видео с одной камеры
N@neurohiveAI-инженер
4 днИсследователи представили 4DAnyone — открытый фреймворк для создания 4D-моделей человека на основе видео с одной камеры с использованием 4D Gaussian Splatting.
Технология позволяет создавать качественные 3D-анимации людей без дорогостоящего студийного оборудования.
- Снижает порог входа для создания 3D-контента, заменяя студии с десятками камер на обычную видеосъемку.
- Позволяет интегрировать реалистичные модели людей в VR, AR и игровые движки.
- Открытый исходный код и веса модели доступны для разработчиков и исследователей.
4DAnyone: 4D-модель человека из видео, снятого одной камерой
Исследователи из Zhejiang University, Robbyant, Ant Group и HKUST представили 4DAnyone - открытый фреймворк, который строит 4D-модель человека на основе видео, снятого с одной камеры. 4DAnyone генерирует 16 согласованных между собой ракурсов, а по ним уже собирается объёмная сцена в формате 4D Gaussian Splatting. Раньше для такого требовалась студия с десятками синхронных камер. Готовую модель человека можно смотреть с любой точки в VR-шлеме, вставлять в игру или AR-сцену, использовать как данные для обучения роботов движению. Наилучшие результаты достигаются при одном человеке в кадре, спокойном движении камеры и облегающей одежде.
3D-модель - это объект, который можно осмотреть со всех сторон, но застывший в одной позе. 4D-модель добавляет четвёртую ось - время. Cцена меняется от кадра к кадру, объект двигается, и при этом на каждый момент времени существует его полное объёмное представление.
В основе фреймворка лежит видеодиффузионный трансформер Wan2.2-TI2V-5B, который дообучили генерировать новые ракурсы человека по 3D-скелету, сохраняя внешность из исходного видео. В скелете оставили 40 ключевых точек: 17 на теле, 6 на стопах, 10 на уровне ладоней и 7 вспомогательных. Детальную разметку лица и суставов пальцев отбросили: такие точки определяются неточно, и метод, следуя за ошибочным положением, выдаёт артефакты. Мимику и форму кистей он вместо этого берёт из исходного видео.
По качеству реконструкции 4DAnyone обходит все сравниваемые методы: 24.15 PSNR против 20.55 у ближайшего конкурента на DNA-Rendering и 23.28 против 19.86 на DyMVHumans.
Проект открытый: код опубликован на GitHub, веса - на Hugging Face.
#Stateoftheart
Кратко (AI)
Исследователи представили 4DAnyone, открытый фреймворк для генерации 4D-моделей человека из видео с одной камеры. Система использует видеодиффузионный трансформер Wan2.2-TI2V-5B и технологию 4D Gaussian Splatting, позволяя создавать объемные сцены без использования студий с десятками камер.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖