SenseNova-Vision: мультимодальная модель для компьютерного зрения
Н@GreenNeuralRobotsAI-инженер
1 месОбзор SenseNova-Vision — мультимодальной генеративной модели (7B, MoT), объединяющей детекцию, OCR, сегментацию и другие задачи компьютерного зрения.
SenseNova‑Vision
Мультимодальная генеративная модель для компьютерного зрения (7B, MoT)
• решает сразу несколько задач без отдельных голов под каждую: детекция, OCR, сегментация, ключевые точки, нормали, глубина, поза камеры
• принимает инструкции на естественном языке
• генерирует текст, изображения или смешанные выходы
• единый подход вместо набора узкоспециализированных моделей
Гитхаб
HF
Демо
#vlm #multimodal #t2i #i2t #detection #segmentation #image2depth #image2normals
Кратко (AI)
Представлена SenseNova-Vision, мультимодальная генеративная модель с архитектурой 7B MoT для задач компьютерного зрения. Она способна выполнять детекцию, OCR, сегментацию и другие операции на основе естественного языка без использования специализированных модулей.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖