← к ленте

ReactBench: инструмент для оценки AI-агентов в разработке на React

1 мес

Команда Million представила ReactBench — бенчмарк для оценки AI-агентов, пишущих код на React, с проверкой через React Doctor.

🌟 ReactBench: инструмент оценки агентов при работе с кодом на React Команда Million, известная инструментами React Doctor, React Scan и Million.js, представила тест для агентов, пишущих код на React. Актуальность ReactBench зеркальна реальному положению дел - около 70% сайтов на JavaScript используют React, а мелкие ошибки в сгенерированном коде тиражируются в огромных масштабах.
Например, сбой Cloudflare в сентябре 2025 года - панель управления и API компании легли из-за одной неверной зависимости в useEffect, которую не поймали ни ревью, ни тесты.
Философия проекта в том, что общие кодинг-бенчмарки проверяют лишь поведение по принципу "тесты прошли - задача засчитана". В ReactBench каждое решение должно ещё и пройти проверку React Doctor, анализатора с более чем 400 правилами, который ищет в коде лишние перерисовки, сломанные эффекты, проблемы с доступностью и сопровождаемостью. 🟡Набор состоит из задач двух типов Write React - реализовать настоящую функцию. Задания этого типа собраны из принятых PR в открытых репозиториях. Агент получает кодовую базу и описание задачи, а скрытые тесты и эталонное решение видит только проверяющая система. Fix React - найти и исправить все баги в существующем компоненте, обнаруженные React Doctor, не создавая при этом новых проблем. Причём агента еще и лишают доступа к линтерам. 🟡Результаты прогонов Само собой, созданием бенча не ограничились и запустили его на топовых моделях. Тут важен небольшой дисклеймер: Бенчмарк сравнивает не модели в чистом виде, а связки модель+агентская оболочка (Codex CLI, Claude Code и другие), и оболочка влияет на итог. По итогам лидируют с минимальным отрывом GPT-5.6 Sol (43,1%) и Fable 5 (41,2%), но важнее разница в цене - прогон Fable 5 обходится в среднем в 5,8 раза дороже, чем Sol. Оптимальным по соотношению стоимость-качество авторы называют GPT-5.6 Terra на средних настройках. Замыкают таблицу GLM 5.2, Sonnet 5, GPT-5.6 Luna и Kimi K2.7 Code. Набор полностью открыт на Github. @ai_machinelearning_big_data #AI #ML #Agents #Benchmark #ReactBench #Million

Кратко (AI)

Команда Million выпустила ReactBench — инструмент для тестирования AI-агентов, специализирующихся на React-разработке. В отличие от стандартных тестов, он использует анализатор React Doctor для проверки качества кода, включая поиск лишних перерисовок и ошибок в useEffect. Лидерами по результатам стали модели GPT-5.6 Sol и Fable 5.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖