← к ленте

Как многоступенчатое ресёрч-ревью спеки с несколькими AI-моделями находит скрытые пробелы

A@ai_drivenAI-инженер
2 нед

Автор описывает, как прогоняет спеку фичи через Opus 5, Grok Heavy, GPT 5.6 Luna и Fable, чтобы найти пропущенные корнер-кейсы перед реализацией.

Показывает, что даже мощные AI-модели не заменяют многократную ресёрч-проверку спецификаций в сложных легаси-проектах.

  • Несколько независимых прогонов разных моделей (Opus 5, Grok Heavy, GPT 5.6 Luna, Fable) находят разные наборы пропущенных кейсов
  • Чем больше и старше кодовая база, тем важнее стадия исследования перед реализацией фичи
  • Автор предлагает автоматизировать этот процесс через skill/MCP, чтобы сократить ручную работу разработчика
Важность исследования контекста Тема заезженная, но я сейчас кодю с Opus 5 и, конечно, провожу новую фичу через research стадию и интервью. Собственно, хоть фича и совсем небольшая, даже после того, когда кажется, что все готово, я все равно прошу опуса доисследовать контекст и проработать корнер кейсы и он действительно находит что-то новое и мы учитываем дополнительные инварианты, т. е. не зря просили доисследовать. Вообще, может показаться, что с появлением новых сильных моделей и харнессов проблема исследования контекста (research фазы) решена. Тем более, я даже явно попросил агента о дополнительном исследовании. Но что в действительности? Вы помните, что у меня Grok Heavy подписка с практически бесконечными лимитами, поэтому я смело попросил опуса запустить 5 сфокусированных грок агентов поисследовать глубже все ли мы с ним учли в спеке. Результат: гроки нашли 9 релевантных пробелов, которые мы не учли в спеке. Ну, всё, куда уж дальше-то копать? Ан нет, грок-то бесконечный у нас, давайте еще один проход 5-ти субагентов запустим. Результат: еще +4 находки. Ну, теперь-то уж точно всё, сколько можно? в 2025-й что ли вернулись? Почти. Мы тут недавно CodeAlive агента перевели на GPT 5.6 Luna (кстати, невероятно цепкая и крутая в исследовании и в code review модель), хороший повод проверить новый режим глубокого анализа нашего агента (он специально запромптчен, чтобы предельно глубоко копать)... Отправил. 2 минуты поисков и вуаля, еще +6 находок и пробелов в спеке, которые Опус потом подтвердила и исправила. Ну, и финально фейблом тоже прошлись, которая дала еще 3 полезных замечания по спеке и несколько мелочей. И только теперь спека готова к реализации. Почему так сложно? Две главные причины: 1. Да, фича хоть и небольшая, но нетривиальная и идет в некоторый конфликт с существующей механикой. 2. Кодовая база уже довольная большая и непростая - за 2+ года набралось более полу миллиона строк кода в сумме, это тоже усложняет задачу агенту. Количество ручной работы при этом можно сократить, завернув всю церемонию в скилл (вы тогда на вопросы будете отвечать где-то ближе к началу и в конце, т. к. каждый новый ваш ответ может поменять траекторию и потребовать доп. проверку контекста). В целом, чем более легаси проект, тем актуальнее будут все эти долгие и упорные перепроверки и тем сложнее будет стадия планирования. Особенно если вы, как и я, хотите за one-shot получить около prod-ready результат. Теперь когда вы услышите, что агенты не работают в enterprise, вы знаете каким постом ответить. Кстати, почему не Haiku 4.5? Хайку очень слабая модель на фоне Грока и Luna, она просто видит сильно меньше и уже подводила меня, поэтому теперь не советую ее (в крайнем случае Sonnet 4.6 хотя бы если у вас только клод подписка). Расскажите как у вас теперь выглядит стадия планирования? Вот теперь думаю раз CodeAlive так здорово спеки умеет ревьюить и граундить, может, есть смысл упаковать это в отдельный MCP/skill метод и отдать агентам в пользование? Актуально это? @ai_driven

Кратко (AI)

Автор рассказывает, как перед реализацией небольшой фичи прогоняет спеку через несколько AI-моделей (Opus 5, Grok Heavy, GPT 5.6 Luna, Fable), каждый раз находя новые пробелы и корнер-кейсы. Делает вывод, что в легаси-проектах с большой кодовой базой стадия research остаётся критически важной даже с сильными современными моделями, и предлагает обернуть процесс в отдельный skill или MCP-метод.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖