Harness Handbook: новый подход к навигации и редактированию кода AI-агентов
D@datastorieslanguagesAI-инженер
1 месОбзор Harness Handbook — метода организации кодовой базы агентов вокруг поведения, упрощающего навигацию и модификацию сложных систем.
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
Способности агента определяются не только базовой моделью, но и его harness — кодом, который собирает промпты, управляет состоянием, вызывает инструменты и крутит control loop. Под новые модели, API и требования harness приходится постоянно дорабатывать, но перед любой правкой нужно сначала найти все места в коде, реализующие нужное поведение. Авторы называют это behavior localization и считают главным узким местом в эволюции harness: запросы формулируются в терминах поведения, а репозиторий устроен по файлам и функциям, и именно этот разрыв всё усложняет.
Решение — Harness Handbook, представление кодовой базы, организованное вокруг поведения, а не структуры файлов. Это трёхуровневое дерево (L1 — обзор системы, L2 — стадии и компоненты, L3 — записи со ссылками на конкретный исходник) плюс state-register view для состояния, разделяемого между стадиями. Строится автоматически: статический анализ через tree-sitter без LLM → раскладка по стадиям через proposer-reviewer loop → синтез дерева. При модификации агент идёт сверху вниз через Behavior-Guided Progressive Disclosure (BGPD): от архитектуры к нужным стадиям и конкретным местам в коде, а потом сверяет кандидатов с текущим исходником. Отдельная полезная деталь — resynchronization: после правок handbook инкрементально обновляет только затронутые части, а ссылки, которые больше не резолвятся, помечает как stale, вместо того чтобы молча указывать на неверный код.
Проверяли на двух open-source harness'ах (Terminus-2 и Codex), 60 запросов на модификацию, планировщик — DeepSeek-V4-Pro, качество планов оценивали три LLM-судьи:
— win rate по качеству плана: 45.6% против 26.7% на Terminus-2 и 38.3% против 28.3% на Codex
— и всё это при меньшем расходе токенов планировщика: −12.7% на Codex и −8.6% на Terminus-2
— по локализации все 24 сравнения recall/precision/F1 в пользу handbook, прирост F1 от +5.0 до +18.8
— слабый планировщик с handbook подбирается к локализации более сильных моделей (GPT-5.5, Claude Opus 4.8) и заметно реже промахивается мимо нужного кода целиком
Paper
Code
Project
Мои обзоры:
Personal blog
Medium
Linkedin
#paperreview
Кратко (AI)
Авторы Harness Handbook предлагают структурировать код AI-агентов не по файлам, а по логическим этапам поведения. Система автоматически строит трехуровневое дерево навигации, что позволяет разработчикам и LLM быстрее находить нужные участки кода для модификации. Тесты на Terminus-2 и Codex показали значительный рост точности локализации изменений при снижении затрат токенов.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖