← к ленте

Сравнение эффективности моделей Codex и Claude Code

J@junior_pmAI-инженер
3 нед

Анализ производительности и стоимости использования моделей GPT-5.6 Terra, Sol, Luna и Sonnet 5 в задачах разработки ПО.

Выбор модели для программирования напрямую влияет на бюджет и скорость разработки.

  • Разные модели имеют разную стоимость токенов и лимиты использования.
  • Агентные оболочки могут значительно увеличивать расход токенов без пропорционального роста качества.
  • Комбинирование моделей для разных этапов разработки позволяет оптимизировать затраты.
#мнение Сейчас Codex лучше Claude Code Здравствуй, неподгоревший читатель. Этот пост про то что сейчас рабочая лошадка из фронтир моделей Если нужен один дефолт -> GPT-5.6 Terra в Codex Pro с medium usege без Fast mode. Мое глубокое субъективное имхо на 3 августа 2026. По кредитной шкале при одинаковом токенном профиле Sol : Terra : Luna = 25 : 10 : 1: Terra жжет в 2,5 раза меньше Sol. При этом на SWE-Bench Pro (если он для вас аргумент) у нее 63,4% против 64,6% -> отдали 1,2 п.п. качества, получили 2,5x емкости лимита Ближайший аналог у Claude -> Sonnet 5, но его стоит доставать под мутный скоуп и широкий рефакторинг. А также по личным расчетам через ccusage стоимость задачи $0.50–1.5+ (с ретраями) и порядка 2% лимита на тарифе в $100 против $1–3 у Sonnet 5 Арифметика дальше проверок была на отдельном аккаунте с $20 подписками: - На Plus фикс в 400 строк через Sol Medium на 5000 строковом проекте на расте съел 15% пятичасового лимита; - Luna Extra High за 25 минут написала 2500 строк с тестами за 5% недели, следующие этапы жрали по 2–6%, а ревью Sol и исправление найденного добра -> еще 4% + 5% - Сопоставимый блок на Opus 5 High съел 35% пятичасового и 4–5% недельного лимита. В интернете примерно тоже самое говорят. Там таже Terra Medium уничтожила всю неделю Plus за шесть часов, пока пользователь Pro гонял Sol Extra High по 6–8 часов в день больше недели без упора в кап. Главный множитель -> тариф, контекст и число переделок. Luna дешевая, пока после нее не приходится звать взрослую модель с веником и как тут жалуются Еще сильнее модели влияет агентная оболочка. Некий Composio прогнал один Kimi K3 через три оболочки на 28 одинаковых задачах: успехи почти равны — 22/28 у Kimi Code, 21/28 у Hermes, 20/28 у Claude Code; медиана расхода -> 61k, 67k и 340k токенов, время -> 297, 179 и 348 секунд. Claude Code сжег в 5,6 раза больше токенов ради почти того же результата. В следующем тесте Codex против Claude Code на 26 задачах Claude взял 19/26, Codex 17/26, но тратил 347 против 236 секунд -> примерно 7,6 против 10 успешных задач в час. Claude точнее на 7,7 п.п., Codex производительнее на 32%. Серия твитов отсюда При этом Claude Max способен быть безумно выгодным: один жосткий пользователь прогнал через Claude Code 21,5 млрд токенов, заплатив около $1000 за подписки https://x.com/wecko_ai/status/2083783073800585326. Но миллиарды токенов не равны миллиардам пользы: длинная история, повторные чтения, кеш и сабагенты прекрасно превращают Max в тыкву за одну жирную сессию И лайфхак: обычный чат с Sol Extra High и Codex расходуют разные пулы, поэтому подключаем GitHub, включая разрешенный приватный репозиторий, делаем ресерч, архитектуру и прототип в чате, а готовый план отправляем Terra в Codex. P.S. Sol Extra High под пиво -> Terra в шахту, Fable 5/gpt 5.6 Sol бесполезные релизы
Сравнение эффективности моделей Codex и Claude Code

Кратко (AI)

Автор сравнивает эффективность моделей Codex и Claude Code, утверждая, что GPT-5.6 Terra превосходит аналоги по соотношению цены и производительности. В посте приводятся личные расчеты потребления лимитов и данные тестов, показывающие, что Claude Code часто расходует значительно больше токенов при сопоставимых результатах. Также дается совет по оптимизации рабочего процесса через разделение задач между разными моделями.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖