21 августа DeepSeek анонсировала экспериментальную мультимодальную версию своего флагмана — deepseek-v4-flash-vision-expi. Модель научилась работать с изображениями (скриншоты, документы, графики, диаграммы) в паре с текстом, при этом текстовые способности (агентность, reasoning, знания) остались на уровне обычной V4-Flash.
Главный фокус — агентные сценарии, где ИИ нужно «видеть» экран. По мультимодальным агентским бенчмаркам новинка сделала большой скачок и подошла вплотную к Claude Opus 4.8, а по некоторым тестам даже опередила её — и всё это по ценам обычной Flash-модели.
- По бенчмаркам: ApexBench (Pass@1) — 36.5 у DeepSeek против 39.4 у Opus-4.8 (почти догнали); ZeroBench — 35.0 против 34.0 у Opus (обошли)
- Изображение стоит максимум 384 токена: всё, что крупнее ~800×800, сжимается до этого размера — 2000×2000 и 5000×5000 съедят одинаковое число токенов
- Тарификация по ценам V4-Flash: при $0.14/1M input это ~18 тысяч изображений на доллар, в off-peak часы — вдвое дешевле
- До 600 изображений в одном запросе, форматы JPEG/PNG/GIF/WebP, до 64 МБ на файл (по данным «Нейронавт»)
- Картинки передаются тремя способами: base64 inline, по прямой ссылке (URL) или через новый Files APIi — загрузка один раз и переиспользование через file_id, что экономит трафик
- Модель работает через три интерфейса: OpenAI Chat Completions, Responses API и Anthropic-совместимый /messages
- Одновременно вышел DeepSeek Harnessi 0.1.1 с нативной поддержкой новой модели; по данным vc.ru модель пока доступна только через DeepSeek API, в чат-боте её нет
Источники отмечают, что модель пока не поддерживает видео и звук («ждём омнимодальность»); ожидается, что дальнейшее развитие пойдёт в сторону полноценной омнимодальности.
Это произошло: Alibaba развернула Wan 3.0 — видеогенератор с омнимодальными референсами — на всех крупных платформах →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖