← к ленте

Google DeepMind представили TIPS: модель для пространственного понимания изображений

Н@GreenNeuralRobotsAI-инженер
1 нед

Обзор модели TIPS от Google DeepMind, которая обеспечивает пространственное понимание объектов на изображениях через анализ отдельных патчей.

TIPS улучшает способность нейросетей «видеть» расположение объектов, что критично для робототехники и сложной обработки изображений.

  • Позволяет нейросетям точнее определять координаты объектов на фото.
  • Подходит для задач сегментации и оценки глубины без дообучения.
  • Модель доступна под лицензией Apache 2.0 и имеет версии для разного железа.
TIPS v2 Пониматор картинок от Google DeepMind с пространственным чутьем. Если CLIP понимает ЧТО на картинке, то TIPS еще и ГДЕ это. Признаки считаются не только для всего изображения, а для каждого участка (патча) отдельно - Zero-shot классификация по текстовым описаниям без дообучения - Пространственные признаки с каждого патча: скармливаешь их в сегментацию, оценку глубины, детекцию - позиции объектов не теряются - Работает на других разрешениях через интерполяцию позиционных эмбеддингов - 1.1B vision-параметров, 389M текстовых, эмбеддинг 1536, разрешение 448 - Вся линейка: от S/14 (22M) до g/14 low-res, есть вариант под слабое железо - ~2B параметров суммарно, лицензия Apache 2.0 Гитхаб HF Демо #vlm #image2features
Google DeepMind представили TIPS: модель для пространственного понимания изображений

Кратко (AI)

Google DeepMind выпустили модель TIPS, которая, в отличие от CLIP, способна определять не только содержание изображения, но и точное пространственное расположение объектов. Модель работает на уровне отдельных патчей, что позволяет использовать её для задач сегментации и детекции объектов.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖