← к умной ленте

ICML 2026: новые бенчмарки для агентов-кодеров — SWE-rebench V2 и CoDA-Bench

На ICML 2026 представили два бенчмарка для оценки AI-агентов в задачах разработки и анализа данных. Nebius обновили SWE-rebench до версии V2, сделав его языково-агностичным и заточенным под сбор данных для RL-обучения агентов на реальных задачах из репозиториев. Параллельно появился CoDA-Benchi — бенчмарк, проверяющий умение агентов находить нужные данные среди связанных файлов и анализировать их на материале Kaggle-ноутбуков.

Оба проекта решают одну проблему: как получить чистые, автоматически проверяемые задачи для тренировки и оценки кодовых агентов в масштабе, без ручной разметки каждого случая.

30 млнисходный пул пул-реквестов
32 тысячиитоговых задач после фильтрации
20%доля проектов с успешно собранным окружением
  • В SWE-rebench V2i окружение под каждый репозиторий собирает собственный интерактивный агент: читает README/конфиги, ставит зависимости, запускает тесты и чинится по логам ошибок; полный цикл удался лишь для 20% проектов
  • Задачи отбирали, прогоняя тесты на версии до и после патча-решения — оставляли только те, где тест уверенно переходил из fail в pass
  • На 300 задачах разобрали траектории фронтир-моделей и составили таксономию типичных проблем — например, тесты цепляют посторонние модули или ждут имён, отсутствующих в постановке задачи
  • Из стартового пула в 30 млн пул-реквестов итоговый пайплайн SWE-rebench V2 оставил только 32 тысячи задач
  • CoDA-Bench строили на файлах из датасетов Kaggle: построили графы совместной встречаемости файлов в ноутбуках, сформировали 'сообщества', чтобы модель искала нужный файл среди связанных, а не случайных
  • Вопросы для CoDA-Bench синтезировали по ячейкам Kaggle-ноутбуков, где считались конкретные числа, задачи итеративно усложняли, чтобы топ-модели справлялись плохо, и проверяли экспертами-людьми
  • В итоге CoDA-Bench собрал 1000 задач и почти 1000 файлов

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖