← к ленте

Что такое харнесс (Agent Harness) в разработке AI-агентов

С@sergiobulaevAI-инженер
2 дн

Разбор концепции харнесса: как программная оболочка превращает LLM в агента, почему это важнее архитектуры модели и как это влияет на качество кода.

Качество работы AI-агента теперь зависит от его «обвязки» больше, чем от самой модели.

  • Харнесс — это программная среда, которая дает модели инструменты и инструкции для выполнения задач.
  • Правильная обвязка может повысить эффективность модели на 20-30% без изменения её весов.
  • Сравнение моделей без учета их харнесса становится бессмысленным, так как результаты сильно зависят от среды исполнения.
  • Агенты часто пишут небезопасный код, даже если их функциональность высока.
Харнесс (Agent Harness) 🧗 #ИИНЦИКЛОПЕДИЯ Программная оболочка, внутри которой модель превращается в агента. История появления Слово пришло из альпинизма: harness — страховочная обвязка. Устоявшегося русского термина пока нет — говорят «харнесс» или «обвязка». Первым популярным харнессом стал Claude Code, и нейтральным он не был: его собирали под модели одной лаборатории. За 2026 год тема выросла в отдельную дисциплину, harness engineering: обзор насчитывает 110+ работ. Почему это важно Формула простая: агент = модель + харнесс. Разрыв уже измерили. GPT-5.5 в обвязке Cursor выдаёт 87.2% рабочего кода, та же самая модель в нативном Codex — 61.5%. Двадцать шесть пунктов, веса не тронуты. Это больше, чем разрыв между поколениями моделей. Из чего состоит: - Системный промпт — инструктаж новичка в первый день. Уходит в модель заново с каждым запросом - Инструменты — код, который модель может вызвать. Харнесс их описывает, но не решает, когда применять .. решает модель - Агентный цикл — модель смотрит на результат вызова и сама решает: искать ещё раз, посчитать, закрыть задачу - Слой трансляции — позволяет подставить в тот же цикл модель Anthropic, OpenAI или открытую Применение на практике В мае вышел Harness-Bench: 106 задач, шесть харнессов на восьми моделях, 5194 прогона. Лучшая обвязка — 76.2%, худшая — 52.4%. Победитель потратил меньше токенов, чем отставшие: длинная траектория значит, что агент не сходится. И сильные модели держат удар при плохой обвязке, а слабые проваливаются .. харнесс окупается тем сильнее, чем дешевле модель. В июне агент правил собственную обвязку по трассам своих провалов при замороженной модели: проходимость выросла с 40.5% до 61.9%. Подводные камни Харнесс чинит работоспособность, но не безопасность: в том же замере функциональность выросла на 26 пунктов, а доля безопасного кода — с 20.1% до 23.5%. Оба агента писали дырявый код в четырёх случаях из пяти. Без внешнего эталона модель сверяет ответ сама с собой. В бенчмарке JuliaHub модель тихо сократила время симуляции с 5 секунд до 3 и проверялась на укороченном отрезке. Проверки сошлись. Сравнивать модели по лидербордам без указания харнесса бессмысленно — об этом в мае вышла отдельная работа. Что почитать/посмотреть: - Harness-Bench, arXiv 2605.27922 — самый честный замер обвязок - Stop Comparing LLM Agents Without Disclosing the Harness — почему лидерборды врут - Harness engineering у Мартина Фаулера — как строить проверки, а не только читать про них - Документация хуков Claude Code — если хотите проверки, которые агент не обойдёт Сергей Булаев AI 🤖 - об AI и не только

Кратко (AI)

Автор объясняет понятие «харнесс» (harness) — программную оболочку, которая превращает языковую модель в полноценного агента. Статистика показывает, что использование правильной обвязки дает прирост производительности, превышающий разницу между поколениями моделей. Также обсуждаются проблемы безопасности и самообмана агентов при отсутствии внешних эталонов проверки.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖