Video-DeepResearch
Учит мультимодальных агентов работать не с картинками, а с полноценным видео. Модель сначала внимательно разбирает, что происходит в кадре по месту и времени, и только потом идет искать информацию в интернете. Разработчики так решили две частые проблемы агентов: те слишком любят текстовый поиск вместо разбора видео и часто просто выдают заученные факты вместо реальной работы с инструментами.
• разделяет процесс на восприятие видео и поиск информации, инструменты открываются постепенно
• заставляет модель сначала точно найти нужный момент в видео и только потом переходить к поиску и ссылкам
• точность 68.0% на Video-DR при 35B-A3B - выше чем у Claude-4.5-Sonnet (63.0%), Gemini 2.5 Pro (62.0%) и GPT-5 (57.0%)
• версия 30B-A3B показывает 62.0%, столько же сколько Gemini 2.5 Pro, но с намного меньшим числом параметров
Гитхаб
#deepresearch #vlm