/messages
Короче, надо пробовать. Стоит как обычно копейки вообще. Должна быть сильно и в обработке документов, и в обработке графики (кроме совсем уж плотных текстов)
https://api-docs.deepseek.com/news/news260821/DeepSeek представил мультимодальную модель deepseek-v4-flash-vision-exp
М@cgeventAI-инженер
1 недDeepSeek выпустил мультимодальную модель deepseek-v4-flash-vision-exp с поддержкой анализа изображений и интеграцией с API OpenAI и Anthropic.
Появление доступных мультимодальных моделей снижает стоимость автоматизации обработки визуальных данных.
- Низкая стоимость обработки изображений делает внедрение ИИ-аналитики доступным для широкого круга задач.
- Совместимость с API OpenAI и Anthropic позволяет легко интегрировать модель в существующие проекты.
- Возможность обработки до 600 изображений за один запрос ускоряет работу с пакетными данными.
Deepseek выкатил мультимодальную модель!
deepseek-v4-flash-vision-exp – принимает картинки вместе с текстом: описание изображений, чтение скриншотов, анализ графиков.
По тексту (агенты, reasoning, знания) – на уровне обычного V4-Flash, а на мультимодальных агентских бенчмарках – большой скачок, близко к Opus 4.8
Картинка стоит максимум 384 токена – всё, что больше ~800×800, сжимается до этого размера. 2000×2000 и 5000×5000 съедят одинаково
– тарификация – по ценам V4-Flash: при $0.14/1M input это ~18 тысяч изображений на доллар (в off-peak часы – вдвое дешевле)
– до 600 изображений в одном запросе, форматы JPEG/PNG/GIF/WebP, есть Files API для переиспользования
– работает через три интерфейса сразу: OpenAI Chat Completions, Responses API и Anthropic-совместимый

Кратко (AI)
Компания DeepSeek анонсировала мультимодальную модель deepseek-v4-flash-vision-exp, способную анализировать изображения, скриншоты и графики. Модель сохраняет производительность текстовой версии V4-Flash, поддерживает до 600 изображений в одном запросе и доступна через API, совместимые с OpenAI и Anthropic.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖