← к ленте

SenseNova-Vision: универсальная генеративная модель для компьютерного зрения

1 мес

SenseTime представила SenseNova-Vision — мультимодальную модель, решающую задачи компьютерного зрения через генеративный интерфейс на базе Bagel-7B-MoT.

Это шаг к созданию универсальных нейросетей, способных заменить десятки узкоспециализированных алгоритмов в задачах анализа изображений.

  • Упрощает разработку систем компьютерного зрения, объединяя разные функции в одной модели.
  • Позволяет решать задачи детекции и сегментации через генеративный интерфейс, а не через специализированные модули.
  • Предоставляет открытый датасет из 50 млн примеров для обучения мультимодальных систем.
🌟 SenseNova-Vision: CV-комбайн в едином генеративном интерфейсе SenseTime открыла веса единой модели зрения SenseNova-Vision. Обычно под каждую задачу (найти объекты, выделить их контуры, оценить глубину сцены) строят отдельную систему или встраивают в модель специальный модуль. Здесь от этого отказались - все задачи модель решает как генерацию текста, картинки или их смеси.
Компания основана в 2014 году и выросла из университетской лаборатории MMLab - оттуда вышла заметная часть китайских специалистов по компьютерному зрению. Известность пришла в 2015-м, когда алгоритм распознавания лиц SenseTime обошёл по точности человеческий глаз. В 2026 году Gartner назвала компанию визионером в генеративном CV.
🟡Механика Рамки объектов и распознанный текст модель выдаёт текстом с координатами, карты глубины и нормалей поверхностей - картинками, а сложную сегментацию - смешанным ответом, где текстовая легенда задаёт цвета маски.
Авторы сравнивают подход с тем, что GPT сделал для текста: вместо зоопарка специализированных систем - один генеративный интерфейс.
Под капотом - открытая мультимодальная модель Bagel-7B-MoT от ByteDance, дообученная без изменений архитектуры. MoT - это смесь трансформеров. Внутри модели живут 2 эксперта с собственными весами - один отвечает за понимание текста и изображений, второй за генерацию картинок, а внимание у них общее, так что оба смотрят на один контекст. Токены распределяются между экспертами жёстко, по типу данных, а не обучаемым маршрутизатором, как в MoE. Для SenseNova-Vision такое устройство пришлось кстати - модель чередует текстовые ответы вроде координат и картиночные вроде масок, и у каждой ветки свой набор весов. 🟡Тесты SenseNova-Vision лидирует среди сопоставимых систем там, где ответ - структурированный текст (детекция, в том числе в плотных сценах с десятками объектов, локализация текста на изображении, ключевые точки). В оценке глубины и нормалей она близка к лучшим генеративным методам, в сегментации держится на уровне конкурентов.
Слабые места тоже есть. В многовидовой 3D-геометрии модель отстаёт от специализированных VGGT и Depth Anything 3, а текст на русском распознаёт заметно хуже, чем на английском.
Вместе с моделью опубликован корпус SN-VC-50M - 50 млн обучающих примеров из открытых наборов: 18,9 млн кадров для структурного понимания, 17,3 млн для плотной геометрии, 12,5 млн для многовидовой геометрии и 1,3 млн для сегментации. 📌Лицензирование: CC-BY-NC-4.0 🟡Модель 🟡Arxiv 🟡Датасет 🟡Демо 🖥GitHub @ai_machinelearning_big_data #AI #ML #СV #MoT #SenseNovaVision #SenseTime

Кратко (AI)

Компания SenseTime выпустила открытую модель SenseNova-Vision, которая объединяет различные задачи компьютерного зрения в едином генеративном интерфейсе. Модель построена на архитектуре Bagel-7B-MoT от ByteDance и способна выполнять детекцию объектов, сегментацию и оценку глубины, выдавая результаты в виде текста или изображений. Вместе с моделью опубликован датасет SN-VC-50M, содержащий 50 миллионов примеров для обучения.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖