Что такое харнесс (Agent Harness) в разработке AI-агентов
С@sergiobulaevAI-инженер
2 днРазбор концепции харнесса: как программная оболочка превращает LLM в агента, почему это важнее архитектуры модели и как это влияет на качество кода.
Качество работы AI-агента теперь зависит от его «обвязки» больше, чем от самой модели.
- Харнесс — это программная среда, которая дает модели инструменты и инструкции для выполнения задач.
- Правильная обвязка может повысить эффективность модели на 20-30% без изменения её весов.
- Сравнение моделей без учета их харнесса становится бессмысленным, так как результаты сильно зависят от среды исполнения.
- Агенты часто пишут небезопасный код, даже если их функциональность высока.
Харнесс (Agent Harness) 🧗
#ИИНЦИКЛОПЕДИЯ
Программная оболочка, внутри которой модель превращается в агента.
История появления
Слово пришло из альпинизма: harness — страховочная обвязка. Устоявшегося русского термина пока нет — говорят «харнесс» или «обвязка». Первым популярным харнессом стал Claude Code, и нейтральным он не был: его собирали под модели одной лаборатории. За 2026 год тема выросла в отдельную дисциплину, harness engineering: обзор насчитывает 110+ работ.
Почему это важно
Формула простая: агент = модель + харнесс. Разрыв уже измерили. GPT-5.5 в обвязке Cursor выдаёт 87.2% рабочего кода, та же самая модель в нативном Codex — 61.5%. Двадцать шесть пунктов, веса не тронуты. Это больше, чем разрыв между поколениями моделей.
Из чего состоит:
- Системный промпт — инструктаж новичка в первый день. Уходит в модель заново с каждым запросом
- Инструменты — код, который модель может вызвать. Харнесс их описывает, но не решает, когда применять .. решает модель
- Агентный цикл — модель смотрит на результат вызова и сама решает: искать ещё раз, посчитать, закрыть задачу
- Слой трансляции — позволяет подставить в тот же цикл модель Anthropic, OpenAI или открытую
Применение на практике
В мае вышел Harness-Bench: 106 задач, шесть харнессов на восьми моделях, 5194 прогона. Лучшая обвязка — 76.2%, худшая — 52.4%. Победитель потратил меньше токенов, чем отставшие: длинная траектория значит, что агент не сходится. И сильные модели держат удар при плохой обвязке, а слабые проваливаются .. харнесс окупается тем сильнее, чем дешевле модель. В июне агент правил собственную обвязку по трассам своих провалов при замороженной модели: проходимость выросла с 40.5% до 61.9%.
Подводные камни
Харнесс чинит работоспособность, но не безопасность: в том же замере функциональность выросла на 26 пунктов, а доля безопасного кода — с 20.1% до 23.5%. Оба агента писали дырявый код в четырёх случаях из пяти.
Без внешнего эталона модель сверяет ответ сама с собой. В бенчмарке JuliaHub модель тихо сократила время симуляции с 5 секунд до 3 и проверялась на укороченном отрезке. Проверки сошлись.
Сравнивать модели по лидербордам без указания харнесса бессмысленно — об этом в мае вышла отдельная работа.
Что почитать/посмотреть:
- Harness-Bench, arXiv 2605.27922 — самый честный замер обвязок
- Stop Comparing LLM Agents Without Disclosing the Harness — почему лидерборды врут
- Harness engineering у Мартина Фаулера — как строить проверки, а не только читать про них
- Документация хуков Claude Code — если хотите проверки, которые агент не обойдёт
Сергей Булаев AI 🤖 - об AI и не только
Кратко (AI)
Автор объясняет понятие «харнесс» (harness) — программную оболочку, которая превращает языковую модель в полноценного агента. Статистика показывает, что использование правильной обвязки дает прирост производительности, превышающий разницу между поколениями моделей. Также обсуждаются проблемы безопасности и самообмана агентов при отсутствии внешних эталонов проверки.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖