мультимодальностьСбросить фильтр ×

DeepSeek выпустил мультимодальную модель V4-Flash-Vision-Exp для визуальных агентов

21 августа DeepSeek анонсировала экспериментальную мультимодальную версию своего флагмана — deepseek-v4-flash-vision-expi. Модель научилась работать с изображениями (скриншоты, документы, графики, диаграммы) в паре с текстом, при этом текстовые способности (агентность, reasoning, знания) остались на уровне обычной V4-Flash.

Главный фокус — агентные сценарии, где ИИ нужно «видеть» экран. По мультимодальным агентским бенчмаркам новинка сделала большой скачок и подошла вплотную к Claude Opus 4.8, а по некоторым тестам даже опередила её — и всё это по ценам обычной Flash-модели.

384 токенамаксимальная стоимость одного изображения
600изображений в одном запросе
$0.14/1Mцена input-токенов (как у V4-Flash)

Полный разбор →

Анонс мультимодальной модели SenseNova-U1.5-8B-MoT

Н@GreenNeuralRobotsAI-инженер
1 нед
SenseNova-U1.5-8B-MoT Превью мультимодалки от SenseNova. Полную ждем Понимание и генерация картинок в одном трансформере. Никакого VAE, текстового энкодера и DiT - Текст и картинка используют разные веса в смеси трансформеров, но аттендят друг на друга - Нативный 4K - Уверенный рендер текста на китайском и английском - Точное редактирование - Понимает структурированные длинные промпты без отдельного обучения - на Qwen-Image Bench - уровень Nano Banana 2 - на ImgEdit-Bench и GEdit-Bench обходит Nano-Banana и Qwen-Image-2 Гитхаб HF Есть 8-шаговая лора Попробовать Comfyui #4k #vlm #imageediting VK | MAX

Анонс dots3-note: открытая мультимодальная модель для агентов

Н@GreenNeuralRobotsAI-инженер
1 нед
dots3-note preview Первая открытая модель от dots studio Для долгоживущих агентов: решает задачи где одной попытки мало и надо исследовать, запоминать и адаптироваться • Мультимодальное понимание - текст, изображения, видео и аудио • Исследование незнакомых сред и обновление памяти по ходу работы • Код, инструменты и многошаговые агентные воркфлоу • 280B всего, 16B активных, #MoE • Контекст 512K • Vision-энкодер MoE ViT 7B, аудио-энкодер 800M Гитхаб HF #agent #multimodal #vlm VK | MAX
Анонс dots3-note: открытая мультимодальная модель для агентов

Qwen выпустил Qwen-MM-Plugins — мультимодальный tool layer для AI-агентов

Команда Qwen опубликовала на GitHub репозиторий Qwen-MM-Plugins — набор плагинов, который добавляет мультимодальные возможности любому агентскому harnessi'у не через встроенную в модель мультимодальность, а через набор вызываемых инструментов. Агент сам обнаруживает нужный capability, вызывает его и встраивает результат в более длинную цепочку действий.

Вместо схемы «агент → одна мультимодальная модель» получается «агент → набор специализированных multimodal tools → цепочка действий»: агент может прочитать изображение, найти объект, вырезать область, прогнать OCR, сопоставить с видео, транскрибировать аудио и собрать всё в единый ответ.

22инструмента для управления Blender
14инструментов для управления FreeCAD

Полный разбор →

ByteDance представила SeedRealtime — full-duplex аудиовизуальную модель для естественного диалога

ByteDance Seed анонсировала SeedRealtimei — нативную аудиовизуальную full-duplexi-модель, которая одновременно смотрит видео, слушает пользователя и отвечает голосом без классической паузы «сначала договорите, потом отвечу». Релиз рассматривается как ответ Alibaba и её Wan Streameri — конкуренция среди мультимодальных моделей смещается от качества ответов к скорости и естественности взаимодействия, то есть к тому, «кто меньше похож на бота с задержкой».

Ключевая архитектурная особенность — единая модель для аудио, видео и текста, учитывающая временную последовательность событий, а не только отдельные кадры. Это позволяет связывать сказанное с происходящим в кадре и понимать, обращаются ли вообще к модели.

Полный разбор →

Mistral выпустила Shieldstral — компактную модель для модерации контента с настройкой через промпт

Французский стартап Mistral 4 августа выпустил Shieldstrali — мультимодальный классификатор безопасности контента на 3 млрд параметров с открытыми весами. В отличие от обычных guardrail-моделей (типа Llama Guard), где таксономия вреда зашита прямо в веса и для смены категорий нужен дообучение, Shieldstral переносит политику модерации в системный промпт: критерии задаются текстом, а не переобучением.

Модель не генерирует текст, а работает как бинарный классификатор да/нет по заданному вопросу, что делает её быстрой и универсальной — один и тот же чекпоинт можно использовать и для детского приложения, и для пентест-инструмента, просто переписав вопрос.

3 млрд параметровразмер модели Shieldstral
54,1M сэмпловобъём обучающего датасета
в 7 раз крупнеево столько раз Shieldstral превосходит конкурентов по размеру

Полный разбор →

Alibaba представила мультимодальную модель эмбеддингов UEmbed

Н@GreenNeuralRobotsAI-инженер
3 нед
Alibaba представила мультимодальную модель эмбеддингов UEmbed

Релиз модели Qwythos-27B-v1 от Empero

Н@GreenNeuralRobotsAI-инженер
3 нед
Qwythos-27B-v1 27B версия модели от Empero на базе Qwen3.5-27B, дообученная под агентские сценарии и работу с инструментами. Архитектура не урезана, все ключевые компоненты (MTP, vision) остались без изменений • нативная MTP-головка - ускорение генерации через self-speculative decoding • встроенная поддержка function calling, сразу выдаёт <tool_call> без доп. обёрток • заточка под CLI-агентов и многошаговые вызовы инструментов • полная мультимодальность, сохранена исходная vision-архитектура • контекст 1M токенов • лицензия Apache-2.0 Квантизации #multimodal #coding #agent #reasoning #toolcall #gguf
Релиз модели Qwythos-27B-v1 от Empero

Представлена мультимодальная модель MODUS

Н@GreenNeuralRobotsAI-инженер
4 нед
MODUS Универсальная мультимодальная модель н абазе BAGEL-7B, может преобразовывать данные между разными типами информации без специальных модулей под каждую задачу. Работает как единый декодер для всех видов данных. • Поддерживает последовательную генерацию - можно использовать результат как новое условие • Самопроверяет результаты • Работает с 16 разными типами данных: текст, изображения, глубина, сегментация, признаки объектов и др • два эксперта: для дискретных последовательностей и для непрерывных данных Гитхаб HF Демо #multimodal #any2any
Ещё ↓