Исследователи дали coding agent задачу собрать training environment и научить vision-модель считать цветные звёзды.
С ограничением по времени.
Агент работал через autoresearch-пайплайн на
NeMo RL,
NeMo Gym и reusable skills. Он сам поднимал окружение, запускал обучение, проверял результаты и двигал эксперимент дальше, пока исследователь только направлял процесс.
Результат:
Qwen3-VL-2B поднялась с
25% до 96.9% accuracy на задаче подсчёта цветных объектов.
Агент ведёт исследовательский цикл:
* собирает среду
* запускает обучение
* оценивает модель
* анализирует результат
* предлагает следующий эксперимент
И вот это уже похоже на будущее ML-разработки: человек задаёт направление и критерии, а агент берёт на себя рутину вокруг экспериментов.
https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/?linkId=100000430716000