Новый бенчмарк Agent's Last Exam для оценки ИИ-агентов
e@cryptoEssayAI-инженер
3 недИсследователи представили Agent's Last Exam — сложный бенчмарк для оценки ИИ-агентов в реальных экономических задачах, где текущие модели показывают низкие результаты.
Появление нового стандарта оценки ИИ показывает, что текущие модели еще далеки от полной замены человека в сложных прикладных задачах.
- Бенчмарк Agent's Last Exam проверяет способность ИИ выполнять долгосрочные задачи в реальном секторе экономики.
- Результаты показывают, что даже продвинутые модели пока не способны эффективно заменить человека в узкоспециализированных профессиях.
- Инструмент станет важным индикатором прогресса в развитии автономных ИИ-агентов.
Но, продолжая тему, не все потеряно для людей
Прочитал результаты огроменной работы, которую проделали Berkley и еще три десятка организаций. Они собрали новый бенч, назвали его Agent's Last Exam, в который включили долгосрочные и максимально практические в экономике задачи. Тут тебе и перенести композицию на нотные листы для каждого участника оркеста, и разработка игр, и настройка станков в химическом производстве, медицинские описания, 3D анимация и даже скоринг выступления акробатов на чемпионате.
Модели уровня Opus 4.7 и GPT 5.5 набрали около 1%, поэтому прямо сегодня все еще можно сказать, что люди незаменимы в экономике, особенно за пределами проверяемых областей типа IT, юристов, финансистов.
Будет очень интересно смотреть как этот бенч постепенно заполняется :)

Кратко (AI)
Исследователи из Berkley и других организаций представили бенчмарк Agent's Last Exam, включающий сложные практические задачи из различных отраслей экономики. Текущие модели, такие как Opus 4.7 и GPT 5.5, справляются с ними лишь на 1%, что подтверждает сохраняющуюся значимость человеческого труда в прикладных сферах.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖