DeepSeek-V4-Flash-Vision-Exp: новая мультимодальная модель
Н@GreenNeuralRobotsAI-инженер
1 недDeepSeek представила экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp с поддержкой зрения для агентских задач.
Появление доступной мультимодальной модели расширяет возможности автоматизации для бизнеса.
- Позволяет агентам анализировать скриншоты и документы без значительного роста затрат.
- Совместимость с популярными API упрощает интеграцию в существующие рабочие процессы.
- Высокая плотность обработки изображений в одном запросе ускоряет работу с визуальными данными.
DeepSeek-V4-Flash-Vision-Exp
Экспериментальная мультимодальная Vision модель DeepSeek для агентов. Текст на уровне V4-Flash, плюс зрение. По визуальным агентским бенчмаркам вплотную к Opus 4.8 при ценах Flash
- Читает скриншоты, документы, анализирует графики и диаграммы - стандартные агентские сценарии с экраном
- Текстовые способности не просели относительно V4-Flash
- Смешанный ввод: текст + изображение в одном запросе
- Три способа передачи картинки: base64 inline, внешний URL, Files API с переиспользованием файлов
- Совместима с OpenAI и Anthropic API
- Форматы: JPEG, PNG, GIF, WebP
- До 384 токенов за изображение - по цене V4-Flash
- До 600 картинок в одном запросе, до 64 МБ на файл
- DeepSeek Harness 0.1.1 поддерживает из коробки
API
#api #vlm
VK | MAX

Кратко (AI)
DeepSeek выпустила экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp, предназначенную для агентских сценариев. Модель поддерживает работу с изображениями, документами и графиками, сохраняя текстовые характеристики версии V4-Flash при высокой производительности и совместимости с API OpenAI и Anthropic.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖