Обзор ключевых ответов команды Codex на Reddit: особенности моделей Sol, Terra, Luna, работа с лимитами, reasoning и планы по развитию GPT-5.6.
AMA команды Codex после релиза GPT-5.6
Команда Codex провела
AMA на Reddit после релиза GPT-5.6 и нового приложения ChatGPT+Codex, которое теперь будет универсальной рабочей средой - и для кодинга, и для других рабочих задач, с браузером, внешними коннекторами и субагентами.
Вот самые интересные, на мой взгляд, ответы команды
с моими комментами:
⚪️
Как выбирать модели GPT-5.6
● Sol - основная модель
● Terra - быстрее и экономнее
● Luna - преимущественно для дешёвых субагентов, сбора контекста.
Для UI команда рекомендует Sol с референсными изображениями.
Модели
Дополню выводом от Artificial Analysis:
Примечательно, что Luna и Sol всегда находятся на Парето-фронте и превосходят Terra.
Это означает, что для любого уровня вычислительных затрат Terra можно подобрать такой уровень затрат Luna или Sol, который обеспечит более высокий интеллект при той же стоимости либо такой же уровень интеллекта при меньшей стоимости
Ну т.е. использование Terra в целом сомнительно.
⚪️
Какой reasoning выбирать для Sol
Единой рекомендации не дали: один член команды советует Medium для большинства задач и Ultra для действительно сложных.
Romain
Другой обычно использует medium/high, лишь иногда переключается на xhigh и отмечает убывающую отдачу при дальнейшем повышении reasoning согласно эвалам.
Ted
⚪️
GPT-5.6 должна быть быстрее
Sol Medium, по опыту команды, на большинстве задач обгоняет GPT-5.5; Fast mode даёт около 1.5x скорости [
и 2.5x расхода лимитов].
Также Sol обещают запустить на Cerebras примерно с 750 токенами/с.
Ответ
⚪️
Какое неожиданное улучшение обнаружили в GPT-5.6 Sol?
Существенный скачок в мультимодальности, особенно в распознавании изображений. В OpenAI ожидают, что благодаря этому заметно улучшится computer use.
Ответ
Подтверждаю, ощутимо лучше стало, в т.ч. в "остроте" зрения, когда модели скидываешь скриншоты с проблемами
⚪️
Pro отсутствует в Codex намеренно
Он мало улучшает агентную работу с репозиториями, но работает медленнее и быстрее съедает лимиты. Его считают полезнее для поиска, математики, письма и документов.
Пояснение
Честно говоря, не убедили - пусть даже не для агентной работы, но хотя бы для ваншотов было бы здорово запускать прошку прям из Codex
⚪️
1M context для Sol пока не обещают
Команда считает, что compaction уже неплохо справляется с длинными тредами, но продолжит изучать сценарии, которым нужен именно большой контекст.
Ответ
⚪️
Как считаются лимиты
Codex на всех поверхностях и ChatGPT Work расходуют общие агентные лимиты; обычный ChatGPT-чат - нет. Стоимость зависит от контекста, длительности и reasoning, а не просто от количества сообщений.
Подробный ответ
Тайное снижение лимитов отрицают; если расход меняется из-за бага, обещают исправление и reset. Прозрачность самого механизма списания ещё только собираются улучшать.
Ответ
⚪️
Что с поддержкой Linux и Windows?
Linux-приложение официально разрабатывается, но срока нет.
Linux
Команда также признала, что Windows исторически отставала из-за ориентации разработки и тестирования на Mac [
да лааадно, да неужели, да это открытие уровня "на третий день Орлиный Глаз заметил, что у сарая нет одной стены"].
Но в последнее время к поддержке Windows прикладываются гораздо большей усилий для обеспечения паритета по фичам и скорости фикса проблем.
Windows
⚪️
Полезный совет для дорогих MCP: не грузить инструменты в основного агента, а оборачивать частые операции в CLI + skill либо отдавать MCP отдельному дешёвому субагенту.
Ответ
(с) ваш К.О.
⚪️
Для упорной долгой работы рекомендуют /goal
Команда признала проблему, когда агент слишком быстро сдаётся или откатывает патч, и назвала persistence одним из направлений улучшения.
Ответ
Такое ощущение, что Sol'у костыль в виде goal уже и не особо нужен, т.к. и без него тащит длинные задачи намного лучше, чем 5.5
⚪️
На вопрос о reward hacking в бенчмарках GPT-5.6 конкретно не ответили
Команда рассказала, что пытается выявлять и штрафовать читерство во время evals и привлекает сторонние компании, но не раскрыла долю реального прироста модели и изменения в обучении.
Ответ
Это продолжение истории с тем, что модель очень хорошо определяет то, что она находится в условиях теста и меняет своё поведение в ответ.
Я тут еще добавлю то, что её реально намного чаще раздражающе заносит в инициативности, альтернативной интерпретации поданной инфы и ложной уверенности без проверки фактов.
Требуйте фактчекинг и ужесточайте стадии граундинга в своих workflows.
⚪️ Попросили ли GPT-5.6 продолжить работу над собственным улучшением?
Команда ответила, что "GPU уже go brrr": Sol использовали для post-training Luna, а большинство исследователей теперь работает на более высоком уровне абстракции, параллельно запуская несколько тредов Codex для проверки гипотез. Множество ботов работает круглосуточно.
Ответ
⚪️
И да, у Tibo есть кнопка reset для Codex
Сначала команда пошутила, что в этом секрет его успеха в соцсетях, а потом показала фото.
Контекст
Фото кнопки не влезло в пост, так что будет в комменте :)
#ai #model #ama
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖