NVIDIA показала, что для сложных многошаговых задач важна не только базовая LLM, но и «харнессi» — инфраструктура вокруг неё. Агентская система Agentic Variation Operators (AVOi), изначально созданная для автооптимизации кода CUDA, была переключена на публичный логический бенчмарк ARC-AGI-3i и прошла все 183 уровня со стопроцентным результатом, хотя сама модель внутри неё, Claude Opus 5, без надстройки показывала на этом же тесте лишь около 30%.
Вывод инженеров: способность ИИ-агента справляться с долгими и сложными задачами определяется в первую очередь окружающей инфраструктурой — постоянной памятью, инструментами взаимодействия со средой, механизмом обратной связи и контролем результата, — а не только «мозгом» в виде базовой модели. Эта идея совпадает с трендом, который в индустрии уже обсуждают отдельно от NVIDIA: фокус смещается с промптов и моделей на архитектуру харнесса.
- AVO изначально разрабатывали для автоматической оптимизации кода CUDA: система 7 дней подряд самостоятельно искала решения и в итоге ускорила работу ядер, обогнав алгоритм FlashAttention-4 на 10,5%
- На ARC-AGI-3 (тест на прохождение игр-головоломок без знания правил заранее) AVO прошла весь публичный набор из 183 уровней с результатом 100%, потратив 6624 действия
- Базовая модель Claude Opus 5 без надстройки AVO показывала на ARC-AGI-3 около 30%
- По данным «Хайтек+», рост эффективности от подключения Claude Opus 5 к архитектуре AVO составил 300%
- AVO научила модель методом проб и ошибок запоминать прошлые шаги, что и дало прирост результата
- По данным канала «Адель и МЛь», похожая философия «харнесс важнее модели» продвигается CEO Y Combinator Garry Tan (проект G Brain, лозунг «Fat Skills, Thin Harness») и сервисом Pi (pi.dev), который критикует deep seek за необратимую обрезку tool outputs и отмечает, что Claude Code слишком тесно сросся со своим родным харнессом
- В том же источнике упоминается, что «NVIDIA и VISTA» построили визуальный харнесс с постоянной памятью, supervisor’ом, инструментами и восстановлением после сбоев вокруг Opus 5; в Claude Code сам Opus 5 тоже решает почти на 100%, но делает больше шагов
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖