OpenAI: SWE-Bench Pro больше не является надежным бенчмарком для кодинга
D@data_secretsAI-инженер
1 месOpenAI заявили, что около 30% задач в бенчмарке SWE-Bench Pro содержат ошибки, и отозвали свою рекомендацию по его использованию для оценки моделей.
SWE-Bench Pro умер и больше не подходит для измерения моделей, – расследование OpenAI
Некоторое время назад OpenAI выпустили статью, в которой заявили, что один из самых популярных бенчмарков для оценки способностй моделей в кодинге – SWE-bench Verified – больше не работает. Они нашли в нем кучу проблем, сказали, что результаты на нем мало чего стоят, и призвали всех переходить на SWE-Bench Pro. Подробности вот: t.me/data_secrets/8779.
Это было в конце февраля, менее 5 месяцев назад. И угадайте, что? Сейчас OpenAI объявили, что провели аналогичный тест для SWE-Bench Pro, и он... тоже оказался сломан.
В случае с SWE-bench Verified основная проблема состояла в том, что модели воспроизводят решения "по памяти" из-за утечек задач в обучающие датасеты. Здесь же проблема скорее в самих задачах. Дело в том, что issues и PR из опенсорсных репозиториев изначально создавались для человеческого сотрудничества через долгие переписки и уточнения, а вовсе не как изолированные, чистые задачи для оценки моделей. В частности, всплыли такие проблемы:
– Слишком строгие тесты, которые навязывают конкретные детали реализации, не указанные в условии задачи, из-за чего множество функционально корректных решений отбраковываются.
– Тесты с низким покрытием, которые, наоборот, недостаточно проверяют запрошенную функциональность, из-за чего неполные решения все равно проходят.
– Вводящие в заблуждение условия, которые направляют модель к неверному поведению или прямо противоречат тому, что требуют тесты.
OpenAI оценивает, что примерно 30% задач SWE-Bench Pro сломаны (автоматический пайплайн проверки пометил как испорченные 200 задач, а кампания ручной аннотации людьми – 249 задач, то есть 34,1%). Когда 1/3 задач бенчмарка – с такими ошибками в условиях, доверять ему сложно, поэтому OpenAI формально отзывает свою прежнюю рекомендацию использовать SWE-Bench Pro и "надеется, что сообщество разработает новые бенчмарки, созданные специально для тестирования возможностей моделей".
openai.com/index/separating-signal-from-noise-coding-evaluations/
КонтекстAI
Ранее OpenAI уже критиковали другой популярный бенчмарк, SWE-bench Verified, из-за утечек данных в обучающие выборки моделей. Теперь компания провела аналогичный аудит SWE-Bench Pro, который ранее считался более надежной альтернативой, и обнаружила в нем системные проблемы с качеством самих тестовых заданий.
Кратко (AI)
OpenAI провели исследование и выяснили, что популярный бенчмарк SWE-Bench Pro содержит множество ошибок в задачах, что делает его результаты недостоверными. Компания отозвала свою рекомендацию использовать этот инструмент, так как около трети задач в нем некорректны или вводят модели в заблуждение. OpenAI призывают сообщество к разработке новых, более качественных методов оценки способностей ИИ в программировании.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖