Graph Engineering: Anthropic о решении проблем валидации мульти-агентных систем
И@AImademydayAI-инженер
3 недРазбор подхода Anthropic к архитектуре мульти-агентных систем: почему графы требуют многоуровневой валидации и как избежать деградации результатов.
Качество работы сложных AI-систем зависит не от количества агентов, а от системы контроля ошибок.
- Переход к графовым архитектурам позволяет масштабировать задачи, но усложняет отладку.
- Использование дешевых моделей для проверки кода или данных ведет к ложным срабатываниям и потере качества.
- Внедрение многоуровневой валидации (включая независимую проверку) критически важно для стабильности AI-пайплайнов.
Graph Engineering. Anthropic починили главный баг мульти-агентов
Графы агентов — новый стандарт. Быстрее, масштабнее, умнее.
Но есть проблема: один сбой в ноде → портит весь результат. И вы даже не понимаете где именно.
Если вы уже пробовали multi-agent пайплайны — вы это видели.
Что происходит под капотом
Раньше: loop engineering
- Один агент
- Линейный процесс
- Шаг → проверка → следующий шаг
Теперь: graph engineering
- Десятки агентов параллельно
- Каждая нода — отдельная задача
- Скорость выше, покрытие лучше
Но как всегда платим мы за этот праздник. Цена выполнены задачи на круг выше.
- Токены улетают быстрее
- Дебаг почти невозможен
- Ошибка масштабируется на весь граф
Ключевой инсайт Anthropic
Проблема не в графах.
Проблема — в валидации.
Если проверка слабая → граф деградирует экспоненциально.
Что они сделали (и что стоит повторить)
1) Разделили валидацию на типы
- Standalone — глубокая проверка финального результата (thermo-nuclear-code-quality-review)
- Embedded — проверка внутри каждого шага
- Second opinion — независимая ревизия без контекста
- использовать Chrome headless вместо тестов в обычном Chrome, так как это дороже в токенах.
Команды:
/verify (анализирует код от начала до конца и подтверждает, что он работает)
toolchain – цепочка инструментов, которая подтверждает.
/review skill для проверки кода
2) Добавили orchestration layer
- Один skill управляет всеми проверками
- Запускает их параллельно
- Собирает единый отчёт
3) Критический момент: модель для проверки
- Дешёвые модели → больше ложных ошибок
- Дорогие модели → меньше, но точнее
- Экономия здесь = деградация всей системы
Реальный кейс:
Haiku нашёл "много багов" → половина ложные
Opus нашёл меньше → но релевантно
Вывод: дешёвая проверка = двойная работа
Практическое применение
Где это даёт максимум ROI:
- Генерация кода → проверка архитектуры + тесты
- Контент-пайплайны → фактчекинг + стиль
- Data pipelines → валидация данных на каждом этапе
- AI-ассистенты → контроль галлюцинаций
Фреймворк, который можно забрать
- Разбей задачу на ноды
- Добавь embedded проверку в каждую
- Повесь second opinion на критические шаги
- Сделай orchestrator skill
- Самую сильную модель — только на проверку
===
В графах выигрывает не тот, у кого больше агентов.
А тот, у кого лучше система валидации.
И это уже не про промпты.
Это про архитектуру.
🎞 Подробнее в видео

Кратко (AI)
Автор анализирует переход от линейных процессов к графовой архитектуре в мульти-агентных системах. Основная проблема таких систем — сложность отладки и накопление ошибок, которую Anthropic предлагает решать через многоуровневую валидацию (standalone, embedded, second opinion) и использование более мощных моделей для контроля качества.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖