multimodalСбросить фильтр ×

SenseNova-Vision: мультимодальная модель для компьютерного зрения

Н@GreenNeuralRobotsAI-инженер
1 мес
SenseNova‑Vision Мультимодальная генеративная модель для компьютерного зрения (7B, MoT) • решает сразу несколько задач без отдельных голов под каждую: детекция, OCR, сегментация, ключевые точки, нормали, глубина, поза камеры • принимает инструкции на естественном языке • генерирует текст, изображения или смешанные выходы • единый подход вместо набора узкоспециализированных моделей Гитхаб HF Демо #vlm #multimodal #t2i #i2t #detection #segmentation #image2depth #image2normals

Это всё на сейчас.