компьютерное зрениеСбросить фильтр ×

Порт модели Depth Anything 3 на чистый C++

Н@GreenNeuralRobotsAI-инженер
4 дн
depth-anything.cpp Порт модели глубины Depth Anything 3 от ByteDance на чистый C++, без Python и PyTorch и быстрее в 1.3 раза. Из одной картинки вытаскивает карту глубины и позу камеры, работает на CPU Создает не только базовую карту глубины, а целый набор данных: - Метрическая глубина (в метрах, а не условные значения) - Уверенность по каждому пикселю (насколько можно доверять этой точке) - Внутренние и внешние параметры камеры (то есть как камера устроена и где она стоит) - 3D-облако точек - Экспорт сразу в GLB / COLMAP / PLY - Многовидовая глубина и поза камеры (несколько фото → общая сцена) #image2depth #imageto3d VK | MAX

4DAnyone: 4D-модель человека по видео с одной камеры

Исследователи из Zhejiang University, Robbyant, Ant Group и HKUST представили открытый фреймворк 4DAnyone, который строит объёмную 4D-модель движущегося человека по обычному видео с одной камеры — без рига, калибровки и штатива. Раньше для такой реконструкции требовалась студия с десятками синхронных камер.

Фреймворк генерирует 16 согласованных между собой ракурсов, которых камера не снимала, и собирает их в сцену формата 4D Gaussian Splattingi — объёмное представление, меняющееся во времени. Готовую модель можно осматривать с любой точки в VR, вставлять в игры, AR-сцены или использовать как обучающие данные для роботов.

16сгенерированных согласованных ракурсов
24.15 PSNRкачество реконструкции на DNA-Rendering
40ключевых точек скелета

Полный разбор →

Инженер из Software Mansion показал ИИ-подсветку в реальном времени на основе карты глубины

Конрад Речко (@reczko_konrad), инженер из польской компании Software Mansion, представил демо, где виртуальный источник света в кадре с веб-камеры «понимает» глубину сцены и может огибать человека, скрываясь за поднятой рукой или плечом ровно в нужный момент — без единой задержки, как настоящее освещение.

Весь пайплайн — от нейросети, вычисляющей карту глубины, до финального рендера со светом — работает целиком на GPU в браузере, без пересылки данных между CPU и GPU. Проект собрал 7.4 млн просмотров за сутки и стал ML-проектом недели по версии Data Secrets.

7.4 миллионапросмотров за сутки
~8 мсвремя обработки кадра на M4 Pro
~16.7 мсдлительность кадра при 60 fps

Полный разбор →

Google DeepMind представили TIPS: модель для пространственного понимания изображений

Н@GreenNeuralRobotsAI-инженер
1 нед
Google DeepMind представили TIPS: модель для пространственного понимания изображений

Как беспилотный трактор ориентируется в коровнике без детектора коров

Х@habr_comмедиа / агрегатор
1 нед
Как беспилотный трактор ориентируется в коровнике без детектора коров

Cohere Labs представила компактную VLM North Micro Vision

1 нед
Cohere Labs представила компактную VLM North Micro Vision

FOVI: новый подход к машинному зрению через фовеацию

М@theworldisnoteasyAI-инженер
1 нед
FOVI: новый подход к машинному зрению через фовеацию

Rest2Art: реконструкция артикулированных объектов из одного кадра

Н@GreenNeuralRobotsAI-инженер
2 нед
Rest2Art Реконструкция артикулированных объектов из одного кадра в закрытом состоянии без единого примера движения. Из обычного захвата делает готовый ассет с геометрией частей и параметрами шарниров • Восстановление геометрии частей + параметров сочленений из single rest-state кадра • Параметры шарниров решаются через геометрическую согласованность с мешем, а не берутся из видео • Качество на уровне методов, которые видят движение Применение: Real-to-Sim-to-Real - реальный объект реконструируют, импортируют в симуляцию, запускают манипуляцию на реальном роботе Гитхаб ждем #image2simulation #imageto3d

Использование веб-камеры для создания псевдо-3D эффекта в гауссовых сценах

Н@GreenNeuralRobotsAI-инженер
2 нед
Интересный кейс Легким движением руки захватом движения головы с веб-камеры ноут превращется в псевдо-3D экран для просмотра гауссовых сцен реддит #gaussian

Проект noRecognition: одежда, скрывающая от систем компьютерного зрения

v@vcnewsмедиа / агрегатор
2 нед
Специалист по безопасности Билл Сверинген год работал над проектом noRecognition — системой, которая генерирует узоры, «невидимые» для камер с алгоритмами компьютерного зрения. Нанести их можно, например, на одежду. Так камера не поставит метку обнаружения. Правда, если запись посмотрит реальный человек, он увидит того, кто носит такой узор vc.ru/services/3071307
Проект noRecognition: одежда, скрывающая от систем компьютерного зрения

SplatEdit.app: локальный инструмент для создания 3D-сплатов в браузере

Н@GreenNeuralRobotsAI-инженер
3 нед
SplatEdit.app уже предлагает полный пайплайн создания сплатов, работает локально в браузере на WebGPU Инструмент поддерживает и изображения, и видео. Для видео автоматически выбираются лучшие кадры Полноформатное извлечение признаков, обнаружение объектов на базе Depth Anything, выравнивание ArUco, умное управление памятью и экспорт в COLMAP в формате zip. Проект пока на ранней стадии. Скоро выйдет SplatEdit 0.3.X https://www.splatedit.app/ #gaussian #webpgu #video2scene #image2scene

InfiniSplat: реконструкция 3D-сцен по одному изображению

Н@GreenNeuralRobotsAI-инженер
3 нед
InfiniSplat Спасаю вас от минимакс-хайпа, пощу на другие темы Реконструкция сцены на гауссианах по одному изображению или по данным с датчика глубины (RGB + Depth), работает при больших смещениях камеры • опирается на монокулярную геометрию, а не на пиксельные сетки • выдает стабильные поверхности при резких сменах вида Гитхаб Демо #gaussian #image2scene #rgbd2scene #depth2scene

Курс по генеративным моделям в компьютерном зрении от Yandex Research и ШАД

M@mashkka_dsAI-инженер
3 нед
Курс по генеративным моделям в компьютерном зрении от Yandex Research и ШАД

Lift4D: открытый код для 4D-реконструкции движущихся объектов из одного видео

Исследователи выпустили фреймворк Lift4Di, который восстанавливает полную 4D-модель динамичного объекта — геометрию, текстуры и нежёсткие деформации во времени — используя только обычное монокулярное видео с одной камеры. Система достраивает даже ракурсы, которые не были видны в исходной съёмке, реконструируя полный 360° обзор объекта.

Код и статья опубликованы в открытом доступе, есть интерактивная демо-страница проекта, где можно самостоятельно покрутить полученную 3D/4D-модель. Работа тестировалась на GPU NVIDIA A100i.

ВыводLift4D реконструирует не только геометрию и текстуры, но и нежёсткие деформации движущихся объектов — то есть отслеживает, как форма объекта меняется во времени

360°полный обзор восстановленной геометрии объекта

Полный разбор →

QuerySplat: реконструкция 3D-сцен без известных позиций камер

Н@GreenNeuralRobotsAI-инженер
3 нед
QuerySplat Реконструкция 3D‑сцен по фото без известных позиций камер. Убирает размытость, типичную для старых query‑методов. • строит гассианы по нескольким изображениям • разделяет геометрию и цвет на две отдельные ветки декодера • работает без привязки к ракурсу съёмки • PSNR на 2.30 дБ выше лучших pose‑free методов • на DL3DV лучший результат в синтезе новых видов Использует Vision Geometric Model как источник 3D‑приоров. Разделение веток снижает артефакты и повышает детализацию. Гитхаб HF #gaussian #image2scene #scenereconstruction

ScreenParser: специализированная модель для разметки веб-интерфейсов

К@kdoronin_blogAI-инженер
3 нед
ScreenParser: специализированная модель для разметки веб-интерфейсов

Google представила SHELLS: систему для быстрой 3D-реконструкции головы

М@cgeventAI-инженер
1 мес

UniD: модель для комплексной разметки видео

Н@GreenNeuralRobotsAI-инженер
1 мес
UniD модель для плотной разметки видео, сразу несколько свойств сцены в одном прогоне • глубина • нормали поверхности • семантическая сегментация • границы объектов • части тела человека • альбедо • затенение • материалы • единый backbone, один проход для всех задач • стабильная согласованность по кадрам Гитхаб ждем #material #video2depth #video2normals #segmentation #relighting

SenseNova-Vision: универсальная генеративная модель для компьютерного зрения

1 мес

Выпущен быстрый диффузионный апскейлер LARP-Scaler

L@lovedeathtransformersAI-инженер
1 мес
Вб сгорел, озон в плену, хованский умер, а мы выпустили быстрый диффузионный апскейлер. Скорость как у ганов, но без артефактов ганов. Бьет нвидию и тд по метричкам https://github.com/Vovanm88/LARP-Scaler/

RiGS: создание 4D-сцен из монокулярного видео

Н@GreenNeuralRobotsAI-инженер
1 мес
RiGS (Rigid-aware 4D Gaussian Splatting) Наконец инструмент, который создаёт динамическую 4D сцену на гауссианах из обычного монокулярного видео В основе модификация VIPE для данных глубины. Синтетические виды помогают строить объём • учитывает жесткие объекты и их движения • нужен GPU уровня A100 • обработка ~30 минут Проект в активной фазе, тестируют на RTX 4090 #video2gaussian #scenereconstruction #4d #videoto4d

Вышел F⁴Splat: опенсорс-реконструктор сцен на гауссианах

Н@GreenNeuralRobotsAI-инженер
1 мес
Вышел в опенсорс реконструктор сцен на гауссианах F⁴Splat Гитхаб Спасибо @Dmitriy_Ru6ts0v #gaussian #scenereconstruction #optimization

Релиз мультимодальной модели GLM-5.2-Vision-NVFP4

Н@GreenNeuralRobotsAI-инженер
1 мес
GLM-5.2-Vision-NVFP4 Версия GLM-5.2 с видением тянет текст и картинки, отвечает на вопросы, описывает, руссуждает по изображениям Прикрутили визуальный энкодер MoonViT от Kimi-K2.6 • работа с высоким разрешением без сильного падения скорости • оптимизация под NVFP4 • мультимодальные эмбеддинги, лучше стыкует текст и визуал • до 4096 токенов на картинку, контекст 1М #vlm #nfvp4 #vqa #qa

IGGT4D: онлайн-понимание 4D-сцен в видеопотоке

Н@GreenNeuralRobotsAI-инженер
1 мес
IGGT4D Онлайн-понимание 4D-сцен в видеопотоке. Строит единую модель сцены на лету - геометрия, движение камеры, объекты. • сегментирование и олтслеживание объектов, глубина • обрабатывает кадры по очереди • переиспользует прошлый контекст через causal spatial-temporal modeling. Всю историю не хранит для экономии памяти • обновляет представление сцены инкрементально • чётко выделяет отдельные объекты. код / веса ждем #vlm #tracking #segmentation #videoto4d #vidfeo2depth

NVIDIA выпустила компактную модель мира Cosmos 3 Edge для роботов и автопилотов

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 1 мес назад

NVIDIA открыла для локального запуска Cosmos 3 Edgei — компактную «модель мира» на 4 миллиарда параметров, предназначенную для роботов, автопилотов и ИИ-агентов. Модель умеет понимать сцену по видео, предсказывать намерения и генерировать действия — то есть одновременно разбирать происходящее и управлять устройством.

Edge — самое лёгкое звено линейки Cosmos 3, которую NVIDIA развивает с весны, и закрывает нижний край семейства для устройств с ограниченными вычислительными ресурсами, в отличие от более тяжёлых Nano и Super, рассчитанных на мощное оборудование.

4Bпараметров Cosmos 3 Edge
2Bпараметров reasoner-части на Nemotron
15 Гцчастота управления роботом

Полный разбор →

SHELLS: топологически согласованная 3D-реконструкция головы

Н@GreenNeuralRobotsAI-инженер
1 мес
SHELLS: Topologically Consistent Multi-view 3D Head Reconstruction via Coarse-Guided Layered Surface Sampling Реконструкция 3D‑головы с текстурами от Google по нескольким видам. Держит топологию, избегает артефактов Сразу пригодная для анимации топология Точность до субмиллиметровых деталей. Жрет 2.4 GB VRAM. Но это VRAM у кого надо VRAM. Кода-весов нет #head #HMR #imageto3d #photogrammetry
Ещё ↓