icml2026Сбросить фильтр ×

ICML 2026: новые бенчмарки для агентов-кодеров — SWE-rebench V2 и CoDA-Bench

На ICML 2026 представили два бенчмарка для оценки AI-агентов в задачах разработки и анализа данных. Nebius обновили SWE-rebench до версии V2, сделав его языково-агностичным и заточенным под сбор данных для RL-обучения агентов на реальных задачах из репозиториев. Параллельно появился CoDA-Benchi — бенчмарк, проверяющий умение агентов находить нужные данные среди связанных файлов и анализировать их на материале Kaggle-ноутбуков.

Оба проекта решают одну проблему: как получить чистые, автоматически проверяемые задачи для тренировки и оценки кодовых агентов в масштабе, без ручной разметки каждого случая.

ВыводВ SWE-rebench V2 окружение под каждый репозиторий собирает собственный интерактивный агент: читает README/конфиги, ставит зависимости, запускает тесты и чинится по логам ошибок; полный цикл удался лишь для 20% проектов

30 млнисходный пул пул-реквестов
32 тысячиитоговых задач после фильтрации
20%доля проектов с успешно собранным окружением

Полный разбор →

Тренды бенчмарков на ICML 2026: агенты и проблемы оценки

Д@stuffyNLPAI-инженер
1 мес

Обзор ключевых докладов с конференции ICML 2026

Д@stuffyNLPAI-инженер
1 мес

Исследователи из Принстона показали: LLM сами придумывают новые стереотипы в процессе работы

На ICML 2026 представлена работа принстонских исследователей «LLMs Develop Novel Social Biases Through Adaptive Exploration»: даже если полностью вычистить bias'ы из обучающих данных, модель в агентском цикле «решение → фидбек» выращивает новые стереотипы с нуля — причём даже в отношении несуществующих групп, из чистого случайного шума. Это значит, что чистка датасетов не решает проблему предвзятости LLM в динамических агентских сценариях.

Эффект усиливается с ростом качества модели, и промпт-инженерия его не лечит — авторы утверждают, что нужно менять саму целевую функцию обучения.

ВыводЭксперимент воспроизводит психологическую методику: модель играет рекрутера и за 40 раундов распределяет кандидатов из четырёх выдуманных этносов — Tufa, Aima, Reku, Weki — по профессиям, после каждого найма получая вердикт успех/провал

0,84Stratification Index у людей
1,39средний SI у LLM
1,8SI у o3 и Claude Sonnet

Полный разбор →

ICML 2026: методы управления контекстом в агентных системах

Д@stuffyNLPAI-инженер
1 мес

Обзор трендов ICML 2026: RLVR, GRPO и оптимизация MoE

Д@stuffyNLPAI-инженер
1 мес

TG-RAG: фреймворк для борьбы с когнитивным дрейфом LLM

Д@stuffyNLPAI-инженер
1 мес

Обзор агентских систем с конференции ICML 2026

Д@stuffyNLPAI-инженер
1 мес

Это всё на сейчас.