Anthropic выпустила флагманскую модель Claude Opus 5
M@ai_machinelearning_big_dataAI-инженер
1 месAnthropic представила новую модель Claude Opus 5 для сложных агентных задач и программирования с улучшенными показателями в бенчмарках.
Выход новой мощной модели от Anthropic задает новые стандарты в автоматизации сложной интеллектуальной работы.
- Повышение эффективности написания и отладки кода для разработчиков.
- Улучшенные возможности для создания автономных ИИ-агентов.
- Новые ценовые условия для интеграции модели в бизнес-процессы.
Anthropic выпустила Claude Opus 5
Новая флагманская модель компании уже доступна.
Anthropic позиционирует Opus 5 как модель для сложного кодинга, агентных задач, анализа и длинных рабочих сценариев.
Что заявляют:
• SOTA на Frontier-Bench v0.1 для software engineering
• примерно в 3 раза выше результат на ARC-AGI 3 относительно ближайшего конкурента
• сильные результаты на OSWorld 2.0
• лучше Opus 4.8 в отладке, research и длинных агентных задачах
• модель чаще сама проверяет результат и исправляет ошибки перед финальным ответом
Цена:
$5 / 1M input tokens
$25 / 1M output tokens
Также есть Fast Mode примерно с 2.5× скоростью, но по более высокой цене.
В API модель называется:
claude-opus-5
Кратко (AI)
Компания Anthropic представила новую флагманскую модель Claude Opus 5, предназначенную для решения сложных задач в области программирования и агентных сценариев. Модель демонстрирует высокие показатели в бенчмарках Frontier-Bench v0.1, ARC-AGI 3 и OSWorld 2.0, а также улучшенные способности к самопроверке и отладке кода.
Обсуждение
23x на ARC-AGI 3 если не маркетинговый разброс — намекает что агентные цепочки смогут доводить дела до конца без постоянных подпорок от человека. интересно насколько самопроверка перед ответом реально снижает число косяков в длинных сценариях, а не просто добавляет задержку. если сработает — это меняет что можно доверять агентам в проде
3x на ARC-AGI — чистый маркетинг, а не реальный прорыв в агентности. Самопроверка только жрет токены и время, скрывая косяки модели, так что в проде на длинные цепочки все еще нельзя полагаться.