Video-DeepResearch: новый подход к мультимодальным агентам
Н@GreenNeuralRobotsAI-инженер
2 недПредставлен метод Video-DeepResearch, позволяющий мультимодальным агентам анализировать видео перед поиском информации в интернете.
Новый метод позволяет ИИ-агентам лучше понимать видео, что делает их ответы более точными и обоснованными.
- Агенты перестают полагаться только на текстовый поиск и начинают анализировать визуальный контекст.
- Повышается точность ответов при работе с видеоматериалами.
- Модели меньшего размера показывают результаты, сопоставимые с флагманскими решениями.
Video-DeepResearch
Учит мультимодальных агентов работать не с картинками, а с полноценным видео. Модель сначала внимательно разбирает, что происходит в кадре по месту и времени, и только потом идет искать информацию в интернете. Разработчики так решили две частые проблемы агентов: те слишком любят текстовый поиск вместо разбора видео и часто просто выдают заученные факты вместо реальной работы с инструментами.
• разделяет процесс на восприятие видео и поиск информации, инструменты открываются постепенно
• заставляет модель сначала точно найти нужный момент в видео и только потом переходить к поиску и ссылкам
• точность 68.0% на Video-DR при 35B-A3B - выше чем у Claude-4.5-Sonnet (63.0%), Gemini 2.5 Pro (62.0%) и GPT-5 (57.0%)
• версия 30B-A3B показывает 62.0%, столько же сколько Gemini 2.5 Pro, но с намного меньшим числом параметров
Гитхаб
#deepresearch #vlm

Кратко (AI)
Разработчики представили метод Video-DeepResearch, который улучшает работу мультимодальных агентов с видеоконтентом. Модель сначала анализирует видеоряд, а затем приступает к поиску информации, что повышает точность ответов по сравнению с текущими лидерами рынка.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖