computer-visionСбросить фильтр ×

Yandex Research и ШАД выложили в открытый доступ курс по генеративным моделям в компьютерном зрении

Yandex Research совместно с преподавателями ШАД опубликовали материалы курса «Генеративные модели в компьютерном зрении» — Visual GenAI. Курс посвящён современным подходам к генерации изображений, видео и 3D-контента, с упором на диффузионные моделиi.

Материалы рассчитаны на тех, кто уже знает базу генеративных моделей и хочет разобраться, что сейчас происходит в research и R&D по этому направлению — вплотную к тому, что применяется в индустрии.

Полный разбор →

Выход UPAL: новый экстрактор локальных фич от ETH Zürich и Microsoft Spatial AI Lab

Н@GreenNeuralRobotsAI-инженер
4 дн
UPAL Новый экстрактор локальных фич от ETH Zürich + Microsoft Spatial AI Lab Одна легкая сеть одновременно находит ключевые точки, линии и дескрипторы Применимо в SLAM, structure-from-motion, сопоставление изображений, 3D-реконструкция #detection #sota VK | MAX
Выход UPAL: новый экстрактор локальных фич от ETH Zürich и Microsoft Spatial AI Lab

SAM2Matting: опенсорсный аналог CorridorKey от Corridor Crew для матирования изображений и видео

Вышла опенсорсная модель SAM2Matting — генерализованное решение для матирования (matting) изображений и видео, построенное на основе SAM2 и SAM3. Авторы называют её ответом на коммерческий инструмент CorridorKeyi от студии Corridor Crew.

В отличие от обычной сегментации, матирование сохраняет информацию о мягких и полупрозрачных краях объекта (например, волосы, дым, стекло), что критично для ротоскопинга и композитинга в видеопродукции.

Полный разбор →

Релиз моделей LingBot-Vision и LingBot-Depth 2.0

Н@GreenNeuralRobotsAI-инженер
1 мес

ZipDepth: компактная модель для оценки глубины

Н@GreenNeuralRobotsAI-инженер
1 мес
ZipDepth Компактная модель для монокулярной оценки глубины. Скорость + точность Работает на слабых устройствах и мобильных NPU 6.1 млн параметров, MIT-лицензия Гитхаб #image2depth #mobile #compact #video2depth

ShutterMuse: ассистент фотографа на базе Qwen3-VL-8B-Instruct

Н@GreenNeuralRobotsAI-инженер
1 мес
ShutterMuse Ассистент фотографа на базе Qwen3-VL-8B-Instruct MLLM для подсказок по съёмке в реальном времени. Помогает оценивать кадры и ставить позы. • советы держать, дорабатывать или отбрасывать снимок • рамки композиции поверх кадра • рекомендации поз для портретов Гитхаб HF - 18 ГБ - на чем это должно работать, с камерой, клавиатурой, в рилтайме? #vlm #assistant

Instok3D: генерация 3D-сцен из обычных фотографий

Н@GreenNeuralRobotsAI-инженер
1 мес
Instok3D Модель для 3D-сцен из обычных фото. Вычленяет объекты в структурированные группы токенов, не требует 3D-разметок. • декомпозиция сцен в группы токенов по инстансам • нативная идентификация объектов • реконструкция, сегментация, манипуляции за один проход Feed-forward архитектура. Работает с непозиционированными изображениями. Код ждем #segmentation3D #3d #imageto3d

LUNA: новая технология 3D-анимации человека без использования скининга

Н@GreenNeuralRobotsAI-инженер
1 мес

ASASR: Adversarial Sobolev Alignment для апскейла изображений в Flux.1

Н@GreenNeuralRobotsAI-инженер
1 мес

Представлен инструмент FaceAnything для реконструкции лиц по видео

Исследователи из Huawei и Мюнхенского университета анонсировали проект FaceAnything, предназначенный для 4D-реконструкции лиц на основе обычных видеозаписей. Технология использует совместное предсказание глубины и канонических координат, что позволяет извлекать облака точек без применения специализированного оборудования. Несмотря на наличие артефактов, ограничивающих точность 3D-моделирования, инструмент может быть эффективно использован для создания визуальных эффектов в композе.

NVIDIA представила Fast-FoundationStereo для оценки глубины

Н@GreenNeuralRobotsAI-инженер
1 мес
Fast-FoundationStereo Стереомодель от NVIDIA. Считает диспаритет по паре фото — строит карту глубины. • гибридная архитектура: трансформеры + CNN • 14.6 млн параметров • zero-shot, без донастройки • работает в реальном времени Дистиллирована из FoundationStereo, бэкбон — EdgeNeXt. Лицензия — nvidia-open-model-agreement. Оптимизирована под GPU NVIDIA. Гитхаб HF #video2depth #stereo2depth

Open-source проект для автоматического распознавания и визуализации птиц

D@denissexyAI-инженер
2 мес
Нашел классный АИ-проект из опенсорса за ~60$ 1. Raspberry Pi слушает ваш балкон/оуно и определяет птиц которые были рядом 2. txt2img нейронка генерирует иллюстрацию этой птицы 3. сгенерированные птицы собираются в интерактивный коллаж, где на каждую можно кликнуть, почитать, посмотреть как в полете выглядит и тп 4. если вывести на отдельный экран, будет ваш персональный постер птиц Тут исходники и инструкция: https://github.com/Twarner491/AvianVisitors А тут пример дашборда с птицами: https://bird.onethreenine.net

Это всё на сейчас.