SenseNova-Vision: мультимодальная модель для компьютерного зрения
Н@GreenNeuralRobotsAI-инженер
1 месSenseNova‑Vision
Мультимодальная генеративная модель для компьютерного зрения (7B, MoT)
• решает сразу несколько задач без отдельных голов под каждую: детекция, OCR, сегментация, ключевые точки, нормали, глубина, поза камеры
• принимает инструкции на естественном языке
• генерирует текст, изображения или смешанные выходы
• единый подход вместо набора узкоспециализированных моделей
Гитхаб
HF
Демо
#vlm #multimodal #t2i #i2t #detection #segmentation #image2depth #image2normals