21 августа DeepSeek анонсировала экспериментальную мультимодальную версию своего флагмана — deepseek-v4-flash-vision-expi. Модель научилась работать с изображениями (скриншоты, документы, графики, диаграммы) в паре с текстом, при этом текстовые способности (агентность, reasoning, знания) остались на уровне обычной V4-Flash.
Главный фокус — агентные сценарии, где ИИ нужно «видеть» экран. По мультимодальным агентским бенчмаркам новинка сделала большой скачок и подошла вплотную к Claude Opus 4.8, а по некоторым тестам даже опередила её — и всё это по ценам обычной Flash-модели.


