ИИ-агент NVIDIA AVO достиг 100% в тесте ARC-AGI-3
P@prohitecавтор про «tech»
6 днАгентская система NVIDIA AVO на базе Claude Opus 5 успешно прошла тест ARC-AGI-3, показав 100% результат в решении логических головоломок.
Это важный шаг к созданию ИИ, способного к самостоятельному обучению и решению сложных логических задач без участия человека.
- Система AVO показала способность к самообучению через метод проб и ошибок.
- Результат 100% в тесте ARC-AGI-3 подтверждает высокий уровень логического мышления агента.
- Технология может значительно ускорить разработку и оптимизацию программного обеспечения.
ИИ-агент NVIDIA AVO сдал публичный тест ARC-AGI-3 на 100% без предварительных инструкций
Инженеры NVIDIA показали в деле свою новую разработку — агентскую систему AVO. Изначально утилиту создавали для автоматической оптимизации кода CUDA. Она 7 дней подряд самостоятельно искала решения и в итоге смогла ускорить работу ядер, обогнав алгоритм FlashAttention-4 на 10,5%.
Чтобы проверить гибкость системы, её переключили на логический тест ARC-AGI-3, где нужно проходить игры-головоломки без знания правил. Внутри AVO работает языковая модель Claude Opus 5, которая сама по себе набирала в этом тесте скромные 30%. Однако надстройка от NVIDIA научила модель методом проб и ошибок запоминать прошлые шаги. В итоге AVO без внешних подсказок прошла все 183 уровня публичного набора данных с результатом 100%, потратив на решение всего 6624 действия.
Кратко (AI)
Агентская система NVIDIA AVO, изначально созданная для оптимизации кода CUDA, продемонстрировала способность к автономному обучению. Используя модель Claude Opus 5, система успешно прошла тест ARC-AGI-3, решив все 183 головоломки без внешних подсказок.
Обсуждение
2Жесть, систему делали под CUDA, а она в итоге ARC-AGI на сотку закрыла. С 30% до 100% прыгнули тупо за счет того, что модель научили запоминать свои косяки. Похоже, этот «слой опыта» можно вообще к любой LLM прикрутить, и это куда круче, чем просто очередной рекорд в бенчмарке.
этот «слой опыта» — обычный memory + reflection, который в агентах лет пять крутят, ничего нового. а 100% в ARC-AGI через 6к попыток — это просто жесткий оверфит под бенчмарк, а не реальный буст для LLM.