← к ленте

Сравнение GPT-5.6 Sol и Claude Opus 5 в бенчмарке ARC-AGI-3

4 нед

Анализ производительности GPT-5.6 Sol и Claude Opus 5 в тесте ARC-AGI-3 с учетом особенностей работы с контекстом и кастомных harness.

Методология тестирования ИИ-моделей критически влияет на их результаты в бенчмарках.

  • Результаты тестов зависят не только от самой модели, но и от инструментов управления контекстом.
  • Использование кастомных методов сжатия данных может значительно завышать показатели в сравнении со стандартными условиями.
  • Для объективной оценки ИИ необходимо учитывать разницу между публичными тестами и официальными рейтингами.
🤔 GPT-5.6 Sol уже обогнал Opus 5 на ARC-AGI-3? Не совсем В официальном рейтинге лидер остаётся прежним: • Claude Opus 5 - 30,2%GPT-5.6 Sol - 7,8% Но ARC-AGI-3 оценивает не только саму модель. Агент должен изучать незнакомые 2D-игры методом проб и ошибок, а результат зависит от памяти, управления контекстом и тестового harness. Стандартный harness не переносит скрытые рассуждения модели между ходами. Когда история превышает примерно 175 000 символов, самые старые взаимодействия удаляются. OpenAI запустила Sol через Responses API с сохранением рассуждений и Compaction - механизмом, который сжимает старый контекст вместо его удаления. На публичных играх результат вырос: 13,3% → 38,3% При этом модель использовала в шесть раз меньше выходных токенов. Но это ещё не доказывает превосходство над Opus 5: 38,3% получены на публичном наборе с кастомным harness, а 30,2% Opus 5 - официальный результат в стандартных условиях. https://x.com/Machinelearrn/status/2082761183732363729
Сравнение GPT-5.6 Sol и Claude Opus 5 в бенчмарке ARC-AGI-3

Кратко (AI)

Автор разбирает результаты сравнения моделей GPT-5.6 Sol и Claude Opus 5 в бенчмарке ARC-AGI-3. Указывается, что успех Sol в тестах с кастомным harness, использующим сжатие контекста, не является прямым доказательством превосходства над Opus 5, так как официальные рейтинги проводятся в стандартных условиях.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖