← к ленте

Qwen представил мультимодальный tool layer для AI-агентов

2 нед

Qwen выпустил набор плагинов, позволяющих AI-агентам использовать мультимодальные возможности как отдельные инструменты, а не встроенные функции модели.

Это упрощает создание сложных AI-агентов, способных выполнять многоэтапные задачи с разными типами данных.

  • Позволяет разработчикам гибко комбинировать мультимодальные функции в рабочих процессах.
  • Снижает зависимость от одной конкретной модели для выполнения всех задач.
  • Упрощает автоматизацию сложных действий, таких как анализ видео или обработка документов.
⚡️ Qwen выпустил мультимодальный tool layer для AI-агентов Идея в том, чтобы мультимодальные возможности подключались к агенту как набор инструментов, а не были жёстко зашиты в конкретную модель. Агент, запущенный внутри Claude Code, Codex, Qwen Code, Gemini CLI или другого harness, может сам обнаружить нужный capability, вызвать его и встроить результат в более длинный workflow. GitHub-репозиторий при этом устроен как коллекция отдельных plugins/capabilities. Например, базовый плагин даёт агенту инструменты вроде: - read_image - read_video - visualize - OCR - object grounding - segmentation - speech transcription - cropping То есть вместо схемы: агент → одна мультимодальная модель получается: агент → набор специализированных multimodal tools → цепочка действий Например, агент может: 1. прочитать изображение; 2. найти нужный объект; 3. вырезать конкретную область; 4. прогнать OCR; 5. сопоставить результат с видео; 6. транскрибировать аудио; 7. собрать всё в единый ответ. https://github.com/QwenLM/Qwen-MM-Plugins #AI #Qwen #Agents #Multimodal #ClaudeCode #Codex

Кратко (AI)

Команда Qwen представила библиотеку Qwen-MM-Plugins, которая позволяет AI-агентам подключать мультимодальные функции (распознавание объектов, OCR, транскрибация и др.) как отдельные инструменты. Это меняет архитектуру работы агентов, позволяя им динамически вызывать нужные возможности в рамках цепочки действий, вместо использования одной монолитной мультимодальной модели.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖