vqaСбросить фильтр ×

Релиз мультимодальной модели GLM-5.2-Vision-NVFP4

Н@GreenNeuralRobotsAI-инженер
1 мес
GLM-5.2-Vision-NVFP4 Версия GLM-5.2 с видением тянет текст и картинки, отвечает на вопросы, описывает, руссуждает по изображениям Прикрутили визуальный энкодер MoonViT от Kimi-K2.6 • работа с высоким разрешением без сильного падения скорости • оптимизация под NVFP4 • мультимодальные эмбеддинги, лучше стыкует текст и визуал • до 4096 токенов на картинку, контекст 1М #vlm #nfvp4 #vqa #qa

Это всё на сейчас.