Как настройки API влияют на результаты GPT-5.6 в бенчмарке ARC-AGI-3
D@data_secretsAI-инженер
4 недИсследование OpenAI показывает, как сохранение ризонинга и управление контекстом повышают эффективность GPT-5.6 Sol в бенчмарке ARC-AGI-3.
Результаты тестирования ИИ-моделей сильно зависят от того, как именно их подключают к среде, а не только от их «интеллекта».
- Стандартные методы тестирования могут искусственно занижать возможности современных моделей.
- Сохранение цепочки рассуждений (reasoning) между шагами критически важно для агентных задач.
- Оптимизация работы с контекстом позволяет не только повысить точность, но и значительно сократить затраты на токены.
Как две галочки в API утроили результат GPT-5.6 на ARC-AGI-3
Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку.
Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело.
Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака.
Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скольящего окна по мере роста истории любые старые действия просто становились для модели невидимыми.
Дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались.
А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%.
Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.

Кратко (AI)
OpenAI выяснили, что низкие результаты модели GPT-5.6 Sol в бенчмарке ARC-AGI-3 были вызваны особенностями тестовой среды, а не слабостью модели. Включение сохранения ризонинга между шагами и оптимизация контекста позволили поднять точность с 13.3% до 38.3%, одновременно снизив расход токенов.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖