← к ленте

Релиз Claude Opus 5: возможности и результаты тестов

N@v_neuroAI-инженер
1 мес

Обзор возможностей новой модели Claude Opus 5 от Anthropic, включая способности к компьютерному зрению и результаты в тестах ARC-AGI 3.

Новое поколение ИИ-моделей демонстрирует способность к автономному решению сложных инженерных задач без прямой визуальной информации.

  • Claude Opus 5 способна самостоятельно создавать инструменты для анализа данных, если ей ограничить прямой доступ к ним.
  • Модель показывает значительный прогресс в решении задач «с нуля» (ARC-AGI 3), что приближает ИИ к более гибкому мышлению.
  • Повышение производительности и снижение стоимости использования делают современные модели более доступными для профессиональных задач.
✴️ Ей запретили смотреть на чертёж. Она написала себе зрение Речь о новой Claude Opus 5. В одном из тестов модель просили собрать 3D-деталь по инженерному чертежу и намеренно лишили возможности этот чертёж увидеть. Opus 5 написала себе конвейер компьютерного зрения, вытащила геометрию из пикселей и собрала деталь. Остальные модели не справились и за пять попыток. Что ещё: ✧ Обгоняет дорогой флагман Fable 5 по коду за полцены ✧ ARC-AGI 3, задачи «с нуля» - втрое выше всех остальных ✧ На Claude Max стала моделью по дефолту, режим ✧ Fast в 2,5 раза быстрее Самое честное в анонсе спрятано в сноске под графиком: главный тест Anthropic прогоняла сама, и на отказах фильтров модель подстраховывала старая Opus 4.8. Рекорд поставлен не в одиночку. 🔗 Подробнее о релизе #claude #anthropic

Кратко (AI)

Anthropic представила новую модель Claude Opus 5, которая продемонстрировала продвинутые навыки компьютерного зрения, самостоятельно создав конвейер для обработки чертежей. Модель показывает высокие результаты в тестах ARC-AGI 3 и превосходит Fable 5 по эффективности написания кода. При этом отмечается, что в некоторых тестах модель работала в связке с предыдущей версией Opus 4.8.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖