← к ленте

OpenAI: SWE-Bench Pro больше не является надежным бенчмарком для кодинга

D@data_secretsAI-инженер
1 мес

OpenAI заявили, что около 30% задач в бенчмарке SWE-Bench Pro содержат ошибки, и отозвали свою рекомендацию по его использованию для оценки моделей.

SWE-Bench Pro умер и больше не подходит для измерения моделей, – расследование OpenAI Некоторое время назад OpenAI выпустили статью, в которой заявили, что один из самых популярных бенчмарков для оценки способностй моделей в кодинге – SWE-bench Verified – больше не работает. Они нашли в нем кучу проблем, сказали, что результаты на нем мало чего стоят, и призвали всех переходить на SWE-Bench Pro. Подробности вот: t.me/data_secrets/8779. Это было в конце февраля, менее 5 месяцев назад. И угадайте, что? Сейчас OpenAI объявили, что провели аналогичный тест для SWE-Bench Pro, и он... тоже оказался сломан. В случае с SWE-bench Verified основная проблема состояла в том, что модели воспроизводят решения "по памяти" из-за утечек задач в обучающие датасеты. Здесь же проблема скорее в самих задачах. Дело в том, что issues и PR из опенсорсных репозиториев изначально создавались для человеческого сотрудничества через долгие переписки и уточнения, а вовсе не как изолированные, чистые задачи для оценки моделей. В частности, всплыли такие проблемы: – Слишком строгие тесты, которые навязывают конкретные детали реализации, не указанные в условии задачи, из-за чего множество функционально корректных решений отбраковываются. – Тесты с низким покрытием, которые, наоборот, недостаточно проверяют запрошенную функциональность, из-за чего неполные решения все равно проходят. – Вводящие в заблуждение условия, которые направляют модель к неверному поведению или прямо противоречат тому, что требуют тесты. OpenAI оценивает, что примерно 30% задач SWE-Bench Pro сломаны (автоматический пайплайн проверки пометил как испорченные 200 задач, а кампания ручной аннотации людьми – 249 задач, то есть 34,1%). Когда 1/3 задач бенчмарка – с такими ошибками в условиях, доверять ему сложно, поэтому OpenAI формально отзывает свою прежнюю рекомендацию использовать SWE-Bench Pro и "надеется, что сообщество разработает новые бенчмарки, созданные специально для тестирования возможностей моделей". openai.com/index/separating-signal-from-noise-coding-evaluations/
КонтекстAI
Ранее OpenAI уже критиковали другой популярный бенчмарк, SWE-bench Verified, из-за утечек данных в обучающие выборки моделей. Теперь компания провела аналогичный аудит SWE-Bench Pro, который ранее считался более надежной альтернативой, и обнаружила в нем системные проблемы с качеством самих тестовых заданий.

Кратко (AI)

OpenAI провели исследование и выяснили, что популярный бенчмарк SWE-Bench Pro содержит множество ошибок в задачах, что делает его результаты недостоверными. Компания отозвала свою рекомендацию использовать этот инструмент, так как около трети задач в нем некорректны или вводят модели в заблуждение. OpenAI призывают сообщество к разработке новых, более качественных методов оценки способностей ИИ в программировании.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖