Релиз мультимодальной модели GLM-5.2-Vision-NVFP4
Н@GreenNeuralRobotsAI-инженер
1 месGLM-5.2-Vision-NVFP4
Версия GLM-5.2 с видением
тянет текст и картинки, отвечает на вопросы, описывает, руссуждает по изображениям
Прикрутили визуальный энкодер MoonViT от Kimi-K2.6
• работа с высоким разрешением без сильного падения скорости
• оптимизация под NVFP4
• мультимодальные эмбеддинги, лучше стыкует текст и визуал
• до 4096 токенов на картинку, контекст 1М
#vlm #nfvp4 #vqa #qa