DeepSeek выпустил модель V4-Flash-Vision-Exp с поддержкой зрения
G@aiofthedayAI-инженер
1 недDeepSeek представила мультимодальную модель V4-Flash-Vision-Exp, способную анализировать изображения и графики, а также обновила API и Harness.
Появление доступных мультимодальных моделей ускоряет развитие ИИ-агентов, способных взаимодействовать с интерфейсами.
- Модель позволяет ИИ-агентам «видеть» экран, что критично для автоматизации работы с ПО.
- Интеграция визуальных данных в легкую модель Flash снижает стоимость обработки изображений.
- Новый Files API упрощает разработку, позволяя повторно использовать загруженные файлы без лишних затрат.
DeepSeek выпустил V4 Flash со зрением
Модель V4-Flash-Vision-Exp понимает не только текст, но и картинки, графики и другие визуальные данные. При этом текстовые возможности остались примерно на уровне обычной V4 Flash.
Главный упор сделали на агентов, которым нужно видеть происходящее на экране. По тестам самой DeepSeek, новая Flash заметно прибавила в мультимодальных агентных задачах и по ряду бенчмарков приблизилась к Opus 4.8.
Модель уже доступна через API. Изображение занимает максимум 384 токена и оплачивается по тарифам V4 Flash.
Одновременно обновили Harness до версии 0.1.1 с поддержкой новой модели и запустили бесплатный Files API, чтобы один раз загрузить картинку и потом использовать её в нескольких запросах.
https://api-docs.deepseek.com/guides/vision/
Кратко (AI)
Компания DeepSeek выпустила мультимодальную модель V4-Flash-Vision-Exp, предназначенную для работы с визуальными данными, включая графики и скриншоты. Модель оптимизирована для агентных задач и доступна через API по тарифам стандартной V4 Flash. Также обновлен инструмент Harness и запущен бесплатный Files API для оптимизации работы с изображениями.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖