← к ленте

Как настройки API влияют на результаты GPT-5.6 в бенчмарке ARC-AGI-3

D@data_secretsAI-инженер
4 нед

Исследование OpenAI показывает, как сохранение ризонинга и управление контекстом повышают эффективность GPT-5.6 Sol в бенчмарке ARC-AGI-3.

Результаты тестирования ИИ-моделей сильно зависят от того, как именно их подключают к среде, а не только от их «интеллекта».

  • Стандартные методы тестирования могут искусственно занижать возможности современных моделей.
  • Сохранение цепочки рассуждений (reasoning) между шагами критически важно для агентных задач.
  • Оптимизация работы с контекстом позволяет не только повысить точность, но и значительно сократить затраты на токены.
Как две галочки в API утроили результат GPT-5.6 на ARC-AGI-3 Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку. Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело. Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака. Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скольящего окна по мере роста истории любые старые действия просто становились для модели невидимыми. Дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались. А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%. Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.
Как настройки API влияют на результаты GPT-5.6 в бенчмарке ARC-AGI-3

Кратко (AI)

OpenAI выяснили, что низкие результаты модели GPT-5.6 Sol в бенчмарке ARC-AGI-3 были вызваны особенностями тестовой среды, а не слабостью модели. Включение сохранения ризонинга между шагами и оптимизация контекста позволили поднять точность с 13.3% до 38.3%, одновременно снизив расход токенов.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖