Google DeepMind представили TIPS: модель для пространственного понимания изображений
Н@GreenNeuralRobotsAI-инженер
1 недОбзор модели TIPS от Google DeepMind, которая обеспечивает пространственное понимание объектов на изображениях через анализ отдельных патчей.
TIPS улучшает способность нейросетей «видеть» расположение объектов, что критично для робототехники и сложной обработки изображений.
- Позволяет нейросетям точнее определять координаты объектов на фото.
- Подходит для задач сегментации и оценки глубины без дообучения.
- Модель доступна под лицензией Apache 2.0 и имеет версии для разного железа.
TIPS v2
Пониматор картинок от Google DeepMind с пространственным чутьем. Если CLIP понимает ЧТО на картинке, то TIPS еще и ГДЕ это. Признаки считаются не только для всего изображения, а для каждого участка (патча) отдельно
- Zero-shot классификация по текстовым описаниям без дообучения
- Пространственные признаки с каждого патча: скармливаешь их в сегментацию, оценку глубины, детекцию - позиции объектов не теряются
- Работает на других разрешениях через интерполяцию позиционных эмбеддингов
- 1.1B vision-параметров, 389M текстовых, эмбеддинг 1536, разрешение 448
- Вся линейка: от S/14 (22M) до g/14 low-res, есть вариант под слабое железо
- ~2B параметров суммарно, лицензия Apache 2.0
Гитхаб
HF
Демо
#vlm #image2features

Кратко (AI)
Google DeepMind выпустили модель TIPS, которая, в отличие от CLIP, способна определять не только содержание изображения, но и точное пространственное расположение объектов. Модель работает на уровне отдельных патчей, что позволяет использовать её для задач сегментации и детекции объектов.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖