Сравнение эффективности моделей Codex и Claude Code
J@junior_pmAI-инженер
3 недАнализ производительности и стоимости использования моделей GPT-5.6 Terra, Sol, Luna и Sonnet 5 в задачах разработки ПО.
Выбор модели для программирования напрямую влияет на бюджет и скорость разработки.
- Разные модели имеют разную стоимость токенов и лимиты использования.
- Агентные оболочки могут значительно увеличивать расход токенов без пропорционального роста качества.
- Комбинирование моделей для разных этапов разработки позволяет оптимизировать затраты.
#мнение
Сейчас Codex лучше Claude Code
Здравствуй, неподгоревший читатель. Этот пост про то что сейчас рабочая лошадка из фронтир моделей
Если нужен один дефолт -> GPT-5.6 Terra в Codex Pro с medium usege без Fast mode. Мое глубокое субъективное имхо на 3 августа 2026. По кредитной шкале при одинаковом токенном профиле Sol : Terra : Luna = 25 : 10 : 1: Terra жжет в 2,5 раза меньше Sol. При этом на SWE-Bench Pro (если он для вас аргумент) у нее 63,4% против 64,6% -> отдали 1,2 п.п. качества, получили 2,5x емкости лимита
Ближайший аналог у Claude -> Sonnet 5, но его стоит доставать под мутный скоуп и широкий рефакторинг. А также по личным расчетам через
ccusage стоимость задачи $0.50–1.5+ (с ретраями) и порядка 2% лимита на тарифе в $100 против $1–3 у Sonnet 5
Арифметика дальше проверок была на отдельном аккаунте с $20 подписками:
- На Plus фикс в 400 строк через Sol Medium на 5000 строковом проекте на расте съел 15% пятичасового лимита;
- Luna Extra High за 25 минут написала 2500 строк с тестами за 5% недели, следующие этапы жрали по 2–6%, а ревью Sol и исправление найденного добра -> еще 4% + 5%
- Сопоставимый блок на Opus 5 High съел 35% пятичасового и 4–5% недельного лимита.
В интернете примерно тоже самое говорят. Там таже Terra Medium уничтожила всю неделю Plus за шесть часов, пока пользователь Pro гонял Sol Extra High по 6–8 часов в день больше недели без упора в кап. Главный множитель -> тариф, контекст и число переделок. Luna дешевая, пока после нее не приходится звать взрослую модель с веником и как тут жалуются
Еще сильнее модели влияет агентная оболочка. Некий Composio прогнал один Kimi K3 через три оболочки на 28 одинаковых задачах: успехи почти равны — 22/28 у Kimi Code, 21/28 у Hermes, 20/28 у Claude Code; медиана расхода -> 61k, 67k и 340k токенов, время -> 297, 179 и 348 секунд. Claude Code сжег в 5,6 раза больше токенов ради почти того же результата. В следующем тесте Codex против Claude Code на 26 задачах Claude взял 19/26, Codex 17/26, но тратил 347 против 236 секунд -> примерно 7,6 против 10 успешных задач в час. Claude точнее на 7,7 п.п., Codex производительнее на 32%. Серия твитов отсюда
При этом Claude Max способен быть безумно выгодным: один жосткий пользователь прогнал через Claude Code 21,5 млрд токенов, заплатив около $1000 за подписки https://x.com/wecko_ai/status/2083783073800585326. Но миллиарды токенов не равны миллиардам пользы: длинная история, повторные чтения, кеш и сабагенты прекрасно превращают Max в тыкву за одну жирную сессию
И лайфхак: обычный чат с Sol Extra High и Codex расходуют разные пулы, поэтому подключаем GitHub, включая разрешенный приватный репозиторий, делаем ресерч, архитектуру и прототип в чате, а готовый план отправляем Terra в Codex.
P.S. Sol Extra High под пиво -> Terra в шахту, Fable 5/gpt 5.6 Sol бесполезные релизы

Кратко (AI)
Автор сравнивает эффективность моделей Codex и Claude Code, утверждая, что GPT-5.6 Terra превосходит аналоги по соотношению цены и производительности. В посте приводятся личные расчеты потребления лимитов и данные тестов, показывающие, что Claude Code часто расходует значительно больше токенов при сопоставимых результатах. Также дается совет по оптимизации рабочего процесса через разделение задач между разными моделями.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖