← к ленте

Scale AI представила бенчмарк HarnessOpt-Bench для оценки способностей моделей к оптимизации ИИ-агентов

1 нед

Scale AI выпустила HarnessOpt-Bench — бенчмарк для тестирования способности ИИ-моделей улучшать код и конфигурации других ИИ-агентов в изолированной среде.

Появление стандартизированных методов оценки способности ИИ к самооптимизации помогает понять реальный прогресс в создании автономных систем.

  • Бенчмарк позволяет объективно измерить, насколько эффективно модели могут улучшать код других агентов.
  • Результаты показывают, что качество базовой модели-оптимизатора является ключевым фактором успеха.
  • Исследование подчеркивает разницу между реальным самоулучшением и оптимизацией в рамках заданных ограничений.
📌Scale AI измерила, насколько хорошо модели переписывают других агентов HarnessOpt-Bench - бенчмарк, который проверяет, умеет ли модель улучшать харнесс чужого ИИ-агента. 🟡Механика Модель-оптимизатор получает исходную обвязку целевого агента, размеченную обратную связь по результатам прогонов и фиксированный бюджет. Она переписывает код, а в конце собирает финальную версию, которую оценивают на отложенном наборе задач - его оптимизатор во время работы не видит. Тесты выполняются в доверенной среде исполнения на базе VeRO - она следит за бюджетом, прячет отложенные данные, считает потраченные токены и сохраняет каждую версию для аудита.
Так сделали для того, чтобы защита от накрутки была свойством песочницы, а не инструкцией, которую модель может обойти.
🟡Результаты Прогнали пять топовых моделей на четырех наборах - OfficeQA, BrowseComp-Plus, Terminal-Bench и GAIA, - всего 111 запусков. Модели четко разошлись по уровням, причем выбор самой модели влияет на результат примерно в 1,8 раза сильнее, чем то, в каком кодинг-агенте она работает. Впереди Opus-5, она выбрала около двух третей доступного запаса улучшений на OfficeQA и половину на BrowseComp-Plus, а всего выиграла три задачи из четырех. Родная среда для модели (Сodex для GPT, Сlaude Сode для Claude, Kimi Cli для Kimi) устойчивого преимущества не дает. Отдельно Scale AI посмотрела динамику по поколениям. У пяти релизов GPT прирост рос монотонно, с +0,03 до +0,49, у пяти релизов Claude Opus - с +0,37 до +0,59.
Важно понимать, что настоящим самоулучшением это назвать пока нельзя, так как одна модель переписывает среду другого агента, исходный тестовый харнесс которого специально был сделан с большим запасом для оптимизации.
@ai_machinelearning_big_data #news #ai #ml
Scale AI представила бенчмарк HarnessOpt-Bench для оценки способностей моделей к оптимизации ИИ-агентов

Кратко (AI)

Компания Scale AI представила бенчмарк HarnessOpt-Bench, предназначенный для оценки способности ИИ-моделей оптимизировать работу других ИИ-агентов. Исследование показало, что выбор модели-оптимизатора влияет на результат сильнее, чем архитектура целевого агента, при этом Opus-5 продемонстрировала лучшие показатели в тестах.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖