4DAnyone: 4D-модель человека по видео с одной камеры
Исследователи из Zhejiang University, Robbyant, Ant Group и HKUST представили открытый фреймворк 4DAnyone, который строит объёмную 4D-модель движущегося человека по обычному видео с одной камеры — без рига, калибровки и штатива. Раньше для такой реконструкции требовалась студия с десятками синхронных камер.
Фреймворк генерирует 16 согласованных между собой ракурсов, которых камера не снимала, и собирает их в сцену формата 4D Gaussian Splattingi — объёмное представление, меняющееся во времени. Готовую модель можно осматривать с любой точки в VR, вставлять в игры, AR-сцены или использовать как обучающие данные для роботов.
Инженер из Software Mansion показал ИИ-подсветку в реальном времени на основе карты глубины
Конрад Речко (@reczko_konrad), инженер из польской компании Software Mansion, представил демо, где виртуальный источник света в кадре с веб-камеры «понимает» глубину сцены и может огибать человека, скрываясь за поднятой рукой или плечом ровно в нужный момент — без единой задержки, как настоящее освещение.
Весь пайплайн — от нейросети, вычисляющей карту глубины, до финального рендера со светом — работает целиком на GPU в браузере, без пересылки данных между CPU и GPU. Проект собрал 7.4 млн просмотров за сутки и стал ML-проектом недели по версии Data Secrets.
Google DeepMind представили TIPS: модель для пространственного понимания изображений

Как беспилотный трактор ориентируется в коровнике без детектора коров

Cohere Labs представила компактную VLM North Micro Vision

FOVI: новый подход к машинному зрению через фовеацию

Rest2Art: реконструкция артикулированных объектов из одного кадра
Использование веб-камеры для создания псевдо-3D эффекта в гауссовых сценах
Проект noRecognition: одежда, скрывающая от систем компьютерного зрения

SplatEdit.app: локальный инструмент для создания 3D-сплатов в браузере
InfiniSplat: реконструкция 3D-сцен по одному изображению
Курс по генеративным моделям в компьютерном зрении от Yandex Research и ШАД

Lift4D: открытый код для 4D-реконструкции движущихся объектов из одного видео
Исследователи выпустили фреймворк Lift4Di, который восстанавливает полную 4D-модель динамичного объекта — геометрию, текстуры и нежёсткие деформации во времени — используя только обычное монокулярное видео с одной камеры. Система достраивает даже ракурсы, которые не были видны в исходной съёмке, реконструируя полный 360° обзор объекта.
Код и статья опубликованы в открытом доступе, есть интерактивная демо-страница проекта, где можно самостоятельно покрутить полученную 3D/4D-модель. Работа тестировалась на GPU NVIDIA A100i.
ВыводLift4D реконструирует не только геометрию и текстуры, но и нежёсткие деформации движущихся объектов — то есть отслеживает, как форма объекта меняется во времени
QuerySplat: реконструкция 3D-сцен без известных позиций камер
ScreenParser: специализированная модель для разметки веб-интерфейсов

Google представила SHELLS: систему для быстрой 3D-реконструкции головы
Демонстрация возможностей зрения фронтир-моделей
UniD: модель для комплексной разметки видео
SenseNova-Vision: универсальная генеративная модель для компьютерного зрения
Выпущен быстрый диффузионный апскейлер LARP-Scaler
RiGS: создание 4D-сцен из монокулярного видео
Вышел F⁴Splat: опенсорс-реконструктор сцен на гауссианах
Релиз мультимодальной модели GLM-5.2-Vision-NVFP4
IGGT4D: онлайн-понимание 4D-сцен в видеопотоке
NVIDIA выпустила компактную модель мира Cosmos 3 Edge для роботов и автопилотов
NVIDIA открыла для локального запуска Cosmos 3 Edgei — компактную «модель мира» на 4 миллиарда параметров, предназначенную для роботов, автопилотов и ИИ-агентов. Модель умеет понимать сцену по видео, предсказывать намерения и генерировать действия — то есть одновременно разбирать происходящее и управлять устройством.
Edge — самое лёгкое звено линейки Cosmos 3, которую NVIDIA развивает с весны, и закрывает нижний край семейства для устройств с ограниченными вычислительными ресурсами, в отличие от более тяжёлых Nano и Super, рассчитанных на мощное оборудование.