Сравнение GPT-5.6 Sol и Claude Opus 5 в бенчмарке ARC-AGI-3
M@machinelearning_interviewAI-инженер
4 недАнализ производительности GPT-5.6 Sol и Claude Opus 5 в тесте ARC-AGI-3 с учетом особенностей работы с контекстом и кастомных harness.
Методология тестирования ИИ-моделей критически влияет на их результаты в бенчмарках.
- Результаты тестов зависят не только от самой модели, но и от инструментов управления контекстом.
- Использование кастомных методов сжатия данных может значительно завышать показатели в сравнении со стандартными условиями.
- Для объективной оценки ИИ необходимо учитывать разницу между публичными тестами и официальными рейтингами.
🤔 GPT-5.6 Sol уже обогнал Opus 5 на ARC-AGI-3? Не совсем
В официальном рейтинге лидер остаётся прежним:
• Claude Opus 5 - 30,2%
• GPT-5.6 Sol - 7,8%
Но ARC-AGI-3 оценивает не только саму модель. Агент должен изучать незнакомые 2D-игры методом проб и ошибок, а результат зависит от памяти, управления контекстом и тестового harness.
Стандартный harness не переносит скрытые рассуждения модели между ходами. Когда история превышает примерно 175 000 символов, самые старые взаимодействия удаляются.
OpenAI запустила Sol через Responses API с сохранением рассуждений и Compaction - механизмом, который сжимает старый контекст вместо его удаления.
На публичных играх результат вырос:
13,3% → 38,3%
При этом модель использовала в шесть раз меньше выходных токенов.
Но это ещё не доказывает превосходство над Opus 5: 38,3% получены на публичном наборе с кастомным harness, а 30,2% Opus 5 - официальный результат в стандартных условиях.
https://x.com/Machinelearrn/status/2082761183732363729

Кратко (AI)
Автор разбирает результаты сравнения моделей GPT-5.6 Sol и Claude Opus 5 в бенчмарке ARC-AGI-3. Указывается, что успех Sol в тестах с кастомным harness, использующим сжатие контекста, не является прямым доказательством превосходства над Opus 5, так как официальные рейтинги проводятся в стандартных условиях.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖