← к ленте

Анализ эффективности Opus 5 и мультиагентных систем

A@ai_drivenAI-инженер
1 мес

Разбор производительности Opus 5 при разных уровнях reasoning effort и преимущества мультиагентных систем по данным системной карточки.

Оптимизация настроек нейросетей позволяет экономить бюджет и время без потери качества.

  • Средние настройки размышлений модели могут быть эффективнее максимальных.
  • Мультиагентные системы ускоряют выполнение сложных программных задач.
  • Выбор правильного уровня effort критичен для баланса стоимости и результата.
Аномалии Opus 5 и оптимальный reasoning effort Если вы используете агентов так активно, что даже 200$ лимитов вам не хватает, ну или просто хотите получать адекватный результат за приемлемое время, то надо озаботиться выбором оптимального уровня размышления модели. Так вот, из официального анонса это неочевидно, а вот из системной карточки вполне. И там видно, что в ряде задач Opus 5 medium effort оказывается даже эффективнее, чем Fable high. При цене почти в 3 раза меньше. Видимо, теперь medium будет дефолтным выбором для пятого опуса. А во Frontier Code Opus 5 medium и вовсе показывает результаты существенно лучше, чем xhigh версия (что, конечно, подозрительно, но ОК). Еще, в системной карточки появились мультиагентные бенчи, и один из них ProgramBench - так вот, там команда из 5-ти агентов достигает того же результат в 2.2 раза быстрее, чем одиночный агент. Привет всем любителям мультиагентных систем. Похоже, что секцию 8.11 Multi-Agent в принципе есть смысл прочитать вдумчиво. И любопытный факт - новенький FrontierBench v0.1 (уже третий "фронтир" све бенчмарк) они прогоняли не в родном харнессе, а в mini-SWE-agent. Результатов прогона medium effort нам почему-то в отчете не дают, только xhigh и high. @ai_driven

Кратко (AI)

Автор анализирует системную карточку модели Opus 5, отмечая, что средний уровень размышлений (medium effort) часто эффективнее высоких настроек при меньшей стоимости. Также подчеркивается преимущество мультиагентных систем в задаче ProgramBench, где команда из пяти агентов работает значительно быстрее одиночного.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖