arc-agi-3Сбросить фильтр ×

OpenAI утроили результат GPT-5.6 Sol на ARC-AGI-3 (13,3%→38,3%), но обогнать Claude Opus 5 это не помогло

OpenAI выяснили, что низкий результат GPT-5.6 Sol на агентном бенчмарке ARC-AGI-3i (всего 7,8% в официальном рейтинге, где лидирует Claude Opus 5 с 30,2%) объясняется не слабостью модели, а стандартным тестовым harnessi'ом. Он после каждого шага удалял приватный ризонинг модели и обрезал историю по скользящему окну — а Sol специально обучена сохранять рассуждения между шагами игры.

Когда OpenAI прогнали Sol через Responses API с сохранением ризонинга и механизмом Compactioni (сжатие контекста вместо удаления — те же настройки, что в продакшене ChatGPT и Codex), результат на публичном сете ARC-AGI-3 подскочил с 13,3% до 38,3%, причём модель потратила в 6 раз меньше выходных токенов. Однако это кастомный харнесс, а не официальные условия теста, поэтому формально Opus 5 (30,2%) по-прежнему считается лидером — прямого превосходства Sol не доказывает.

ВыводСтандартный harness ARC-AGI-3 удаляет весь приватный ризонинг модели после каждого действия в игре

38,3%новый результат Sol с кастомным harness
13,3%старый результат Sol на стандартном harness
30,2%официальный результат Claude Opus 5

Полный разбор →

Это всё на сейчас.