Команда Qwen опубликовала на GitHub репозиторий Qwen-MM-Plugins — набор плагинов, который добавляет мультимодальные возможности любому агентскому harnessi'у не через встроенную в модель мультимодальность, а через набор вызываемых инструментов. Агент сам обнаруживает нужный capability, вызывает его и встраивает результат в более длинную цепочку действий.
Вместо схемы «агент → одна мультимодальная модель» получается «агент → набор специализированных multimodal tools → цепочка действий»: агент может прочитать изображение, найти объект, вырезать область, прогнать OCR, сопоставить с видео, транскрибировать аудио и собрать всё в единый ответ.
22инструмента для управления Blender
14инструментов для управления FreeCAD
- Базовый плагин даёт инструменты: read_image, read_video, visualize, OCR, object grounding, segmentation, speech transcription, cropping
- Поддерживаются изображения, видео, документы и 3D-модели с динамическим разрешением; также есть чат по картинкам и веб-поиск
- Для длинных видео реализована память через иерархический граф для QA
- Есть инструменты редактирования и генерации видео, картинок и аудио
- Управление Blender через Python — 22 инструмента; управление FreeCAD — 14 инструментов, включая FEM-анализi
- Каждая способность оформлена как скилл плюс опциональный MCPi-сервер, запускается через uvx; единый конфиг ставится один раз и работает в Claude Code, Codex, Qoder, OpenClaw, Qwen Code, Gemini CLI
- Проект распространяется по лицензии Apache-2.0, установка — одной командой через install.sh; репозиторий: github.com/QwenLM/Qwen-MM-Plugins
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖