← к ленте

Video-DeepResearch: новый подход к мультимодальным агентам

Н@GreenNeuralRobotsAI-инженер
2 нед

Представлен метод Video-DeepResearch, позволяющий мультимодальным агентам анализировать видео перед поиском информации в интернете.

Новый метод позволяет ИИ-агентам лучше понимать видео, что делает их ответы более точными и обоснованными.

  • Агенты перестают полагаться только на текстовый поиск и начинают анализировать визуальный контекст.
  • Повышается точность ответов при работе с видеоматериалами.
  • Модели меньшего размера показывают результаты, сопоставимые с флагманскими решениями.
Video-DeepResearch Учит мультимодальных агентов работать не с картинками, а с полноценным видео. Модель сначала внимательно разбирает, что происходит в кадре по месту и времени, и только потом идет искать информацию в интернете. Разработчики так решили две частые проблемы агентов: те слишком любят текстовый поиск вместо разбора видео и часто просто выдают заученные факты вместо реальной работы с инструментами. • разделяет процесс на восприятие видео и поиск информации, инструменты открываются постепенно • заставляет модель сначала точно найти нужный момент в видео и только потом переходить к поиску и ссылкам • точность 68.0% на Video-DR при 35B-A3B - выше чем у Claude-4.5-Sonnet (63.0%), Gemini 2.5 Pro (62.0%) и GPT-5 (57.0%) • версия 30B-A3B показывает 62.0%, столько же сколько Gemini 2.5 Pro, но с намного меньшим числом параметров Гитхаб #deepresearch #vlm
Video-DeepResearch: новый подход к мультимодальным агентам

Кратко (AI)

Разработчики представили метод Video-DeepResearch, который улучшает работу мультимодальных агентов с видеоконтентом. Модель сначала анализирует видеоряд, а затем приступает к поиску информации, что повышает точность ответов по сравнению с текущими лидерами рынка.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖