OpenAI выяснили, что низкий результат GPT-5.6 Sol на агентном бенчмарке ARC-AGI-3i (всего 7,8% в официальном рейтинге, где лидирует Claude Opus 5 с 30,2%) объясняется не слабостью модели, а стандартным тестовым harnessi'ом. Он после каждого шага удалял приватный ризонинг модели и обрезал историю по скользящему окну — а Sol специально обучена сохранять рассуждения между шагами игры.
Когда OpenAI прогнали Sol через Responses API с сохранением ризонинга и механизмом Compactioni (сжатие контекста вместо удаления — те же настройки, что в продакшене ChatGPT и Codex), результат на публичном сете ARC-AGI-3 подскочил с 13,3% до 38,3%, причём модель потратила в 6 раз меньше выходных токенов. Однако это кастомный харнесс, а не официальные условия теста, поэтому формально Opus 5 (30,2%) по-прежнему считается лидером — прямого превосходства Sol не доказывает.
- Стандартный harness ARC-AGI-3 удаляет весь приватный ризонинг модели после каждого действия в игре
- Скользящее окно харнесса делает старые действия невидимыми для модели, когда история превышает примерно 175 000 символов
- OpenAI прогнали Sol через Responses API с сохранением рассуждений и Compaction — сжатием старого контекста вместо его обрезания
- Средний результат человека на ARC-AGI-3 — 48%
- Sol также успешно прошла Pokémon FireRed и решила гипотезу о двойном покрытии циклов
- Официальный рейтинг: Claude Opus 5 — 30,2%, GPT-5.6 Sol — 7,8%
- Исследование опубликовано OpenAI по ссылке openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖