← к ленте

Graph Engineering: Anthropic о решении проблем валидации мульти-агентных систем

И@AImademydayAI-инженер
3 нед

Разбор подхода Anthropic к архитектуре мульти-агентных систем: почему графы требуют многоуровневой валидации и как избежать деградации результатов.

Качество работы сложных AI-систем зависит не от количества агентов, а от системы контроля ошибок.

  • Переход к графовым архитектурам позволяет масштабировать задачи, но усложняет отладку.
  • Использование дешевых моделей для проверки кода или данных ведет к ложным срабатываниям и потере качества.
  • Внедрение многоуровневой валидации (включая независимую проверку) критически важно для стабильности AI-пайплайнов.
Graph Engineering. Anthropic починили главный баг мульти-агентов Графы агентов — новый стандарт. Быстрее, масштабнее, умнее. Но есть проблема: один сбой в ноде → портит весь результат. И вы даже не понимаете где именно. Если вы уже пробовали multi-agent пайплайны — вы это видели. Что происходит под капотом Раньше: loop engineering - Один агент - Линейный процесс - Шаг → проверка → следующий шаг Теперь: graph engineering - Десятки агентов параллельно - Каждая нода — отдельная задача - Скорость выше, покрытие лучше Но как всегда платим мы за этот праздник. Цена выполнены задачи на круг выше. - Токены улетают быстрее - Дебаг почти невозможен - Ошибка масштабируется на весь граф Ключевой инсайт Anthropic Проблема не в графах. Проблема — в валидации. Если проверка слабая → граф деградирует экспоненциально. Что они сделали (и что стоит повторить) 1) Разделили валидацию на типы - Standalone — глубокая проверка финального результата (thermo-nuclear-code-quality-review) - Embedded — проверка внутри каждого шага - Second opinion — независимая ревизия без контекста - использовать Chrome headless вместо тестов в обычном Chrome, так как это дороже в токенах. Команды: /verify (анализирует код от начала до конца и подтверждает, что он работает) toolchain – цепочка инструментов, которая подтверждает. /review skill для проверки кода 2) Добавили orchestration layer - Один skill управляет всеми проверками - Запускает их параллельно - Собирает единый отчёт 3) Критический момент: модель для проверки - Дешёвые модели → больше ложных ошибок - Дорогие модели → меньше, но точнее - Экономия здесь = деградация всей системы Реальный кейс: Haiku нашёл "много багов" → половина ложные Opus нашёл меньше → но релевантно Вывод: дешёвая проверка = двойная работа Практическое применение Где это даёт максимум ROI: - Генерация кода → проверка архитектуры + тесты - Контент-пайплайны → фактчекинг + стиль - Data pipelines → валидация данных на каждом этапе - AI-ассистенты → контроль галлюцинаций Фреймворк, который можно забрать - Разбей задачу на ноды - Добавь embedded проверку в каждую - Повесь second opinion на критические шаги - Сделай orchestrator skill - Самую сильную модель — только на проверку === В графах выигрывает не тот, у кого больше агентов. А тот, у кого лучше система валидации. И это уже не про промпты. Это про архитектуру. 🎞 Подробнее в видео
Graph Engineering: Anthropic о решении проблем валидации мульти-агентных систем

Кратко (AI)

Автор анализирует переход от линейных процессов к графовой архитектуре в мульти-агентных системах. Основная проблема таких систем — сложность отладки и накопление ошибок, которую Anthropic предлагает решать через многоуровневую валидацию (standalone, embedded, second opinion) и использование более мощных моделей для контроля качества.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖