benchmarksСбросить фильтр ×

Примеры рекурсивного самосовершенствования ИИ-агентов

F@FuturisAI-инженер
4 нед
Примеры рекурсивного самосовершенствования ИИ-агентов

Обзор бенчмарка Senior SWE-Bench

A@ai_productAI-инженер
1 мес
И вот это интересный бенчмарк разработческий - по реально сформулированным задачам и с ожиданием определенного "синьорного качества" - Senior SWE-Bench В лидерах Opus 4.8, Sonnet 5 (но читерит много), GPT-5.5 https://senior-swe-bench.snorkel.ai/

Результаты бенчмарков моделей в Cursor

A@ai_productAI-инженер
1 мес
Результаты Fable и Sonnet в бенчмарках Cursor (реальных разработческих задачах) Fable просто всех порвал. Можно ставить medium effort даже и получать результаты лучше всех остальных. По эффективности за доллар нормчик GPT-5.5 extra high и их собственнный Composer 2.5. Китайские подотстали... https://cursor.com/evals

Анализ производительности и стоимости Claude Fable 5 в агентных цепочках

T@kryak_startupAI-инженер
1 мес

Fable 5 показала рекордные результаты в бенчмарке Remote Labor Index

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 1 мес назад

Center for AI Safety (CAIS) обновил результаты бенчмарка Remote Labor Index (RLI), предназначенного для оценки качества ИИ-агентов в задачах удаленной работы. Бенчмарк базируется на реальных проектах фрилансеров с платформы UpWork, а результаты моделей оцениваются путем сравнения с работой живых специалистов.

Лидером тестирования стала модель Fable 5, набравшая 16,1% (по данным CodeCamp). Для сравнения, показатели других актуальных моделей значительно ниже: Opus 4.8 набрал 8,3%, а GPT-5.5 — 6,3%. При этом на момент запуска бенчмарка лучшие решения справлялись лишь с 2,5% задач. Fable 5 продемонстрировала особые успехи в 3D, CAD, визуализации и редактировании видео.

Стоимость выполнения одной задачи в рамках теста была ограничена 50 долларами для большинства моделей и 150 долларами для Fable. По оценкам GPT-5.2 Pro, каждый процент прироста в RLI коррелирует с потенциальным влиянием на рынок труда США в диапазоне от 13 до 54 миллиардов долларов, в зависимости от охвата сегментов удаленной работы.

В дальнейшем CAIS планирует внедрить систему «критика», которая будет проверять результаты работы ИИ перед их финальной оценкой. Также исследователи намерены изучить зависимость эффективности выполнения задач от масштабирования вычислительных мощностей и финансовых затрат.

Инициатива по созданию нового бенчмарка для AI-агентов

L@llm_under_hoodAI-инженер
1 мес
А не пора ли нам сделать новый LLM бенчмарк про агентов? C прицелом на Agentic Commerce, Personal OS, threats, AI Coding и другие актуальные типы задач. И заодно найти новый хороший дом для публикации отчетов, ибо TimeToAct уже так хорошо не справляется с задачей. Ваш, @llm_under_hood 🤗

Анализ эффективности мультиагентного оркестратора Fugu Ultra от Sakana AI

Компания Sakana AI представила мультиагентный оркестратор Fugu Ultra, предназначенный для распределения сложных задач между различными LLM. Анализ показал, что система демонстрирует высокие результаты в задачах по программированию, однако значительно уступает топовым моделям, таким как Claude 3 Opus, по показателям скорости. Эксперты отмечают, что текущая реализация Fugu Ultra является экономически невыгодной для масштабируемого бизнеса из-за высокой стоимости использования при сопоставимой с frontier-моделями эффективности.

OpenAI представила GPT-6 Sol: сравнение с Mythos 5

P@pppromptAI-инженер
1 мес
OpenAI хвастается, что новая модель GPT-6 Sol опережает Mythos 5 от Anthropic. Примечательно, что первым в списке бенчмарков идет TerminalBench - как модель справляется с задачами в терминале. И это единственный бенчмарк, где идет сравнение с Mythos 5, кстати 😂 Ждем когда раскатают на всех. Напишите, если у вас уже появилась превьюха. @ppprompt

Анализ бенчмарков для моделей с длинным контекстом

M@mashkka_dsAI-инженер
1 мес
🧐#paperwatch Бенчмарки по длинному контексту-2026: что не учтено? В новом выпуске #paperwatch Денис Шевелев разбирает особенности бенчмарков длинного контекста: ✔️отход от буквального соответствия needle-тестов; ✔️то, как реагируют создатели тестов на расширение контекстного окна; ✔️способы борьбы с насыщением и т.д. 👀YouTube #paperwatch

Проблема деградации внимания в LLM при больших контекстных окнах

A@ai_drivenAI-инженер
2 мес

Это всё на сейчас.