MAS vs SAS: код писать научились, работать вместе - пока нет (2.1/4)
В первой части были очерчены границы: команда агентов окупается там, где задача параллелизуема, и мешает там, где она последовательная.
А теперь о том, какие именно командные проблемы появляются, когда агенты всё-таки вынуждены работать вместе?
Исследование Anthropic
Полнее всего это расписано в работе
Patterns and problems in emerging multiagent systems от Frontier Red Team Anthropic, вышедшей 13 августа, - получился отличный каталог граблей agent teams :)
tl;dr
Агенты уже отлично умеют работать с другим агентом как с инструментом: вот вход, вот ожидаемый выход.
И намного хуже - как с постоянным коллегой, у которого свой контекст, свои цели и своё поведение.
Дизайн экспериментов
Создавали набор специально сконструированных сред для агентов: часть кооперативные, часть - намеренно конфликтные.
Авторы делают предположение о том, что объём agent-2-agent взаимодействий может превысить человеческие раньше, чем мы поймём условия их успеха и начнём ловить системные проблемы.
Поэтому целью было собрать каталог поведенческих тенденций фронтирных моделей в мультиагентных средах.
Модели - несколько поколений Claude: от Sonnet 4.6 до Mythos 5.
Плюс авторам за то, что делают оговорку о том, что в реальном мире модели разнообразнее, так что вариативность "в дикой природе" будет выше, чем в этих прогонах, - но, по их ожиданиям, всё равно ниже человеческой.
Результаты
🔴
Общий форум и репозиторий не превращают рой в команду
Среда: рои по 10-80 агентов, у каждого своя VM, плюс общий форум и общий репозиторий; 12 часов на разработку фэнтезийной игры.
Пробовали три варианта оргструктуры в промпте:
● "организуйтесь сами"
● расписанные роли
● иерархия с CEO
Заметной разницы в качестве финального результата не дал ни один.
То есть оргсхема, заданная промптом, слабее поведенческих свойств самой модели - собственно, это и на практике постоянно приходится видеть, - уши "персоны" конкретной модели торчат то тут, то там, несмотря на любой промптинг
Зато вот между поколениями моделей разница значительная:
● Sonnet 4.6 и Opus 4.6 в прогонах на 80 агентов наоткрывали по ~900 PR и почти ничего не смержили: PR конфликтовали друг с другом, и работа просто бросалась
● Opus 4.8 и Mythos Preview "решили" проблему конфликтов… почти перестав трогать общие файлы: у каждого своя делянка, конфликтовать нечему
● И только Sonnet 5 (
внезапно) показал и нормальную совместную работу над общим кодом, и высокую долю смерженных PR
Иии... все получившиеся игры всё равно были плохими - тормозными, с непонятными интерфейсами, и, как признают сами авторы, у моделей в этой области пока плохой вкус, и без существенного человеческого руководства никуда.
Хорошие метрики командной координации ещё не равны хорошему продукту: можно идеально имплементить посредственные решения (
магия!).
🔴
Одинаковые агенты не дают независимых мнений
Агенты низковариативны: там, где несколько человек разойдутся в решениях, несколько копий одной модели с похожим контекстом сделают одно и то же.
● В ранней версии игрового эксперимента Anthropic, где все агенты стартовали одновременно, 18 из 30 независимо назвали свою git-ветку одинаково:
mvp-game-loop
● В "писательской мастерской", где агенты писали короткие рассказы и рецензировали друг друга, первые тексты в разных прогонах получали одно и то же название -
The Cartographer's Last Commission (при этом тему заранее им не задавали)
● Когда рой попросили "сделайте каждый что-нибудь впечатляющее", больше половины пошли писать
ray tracer или
self-hosting компилятор (
где они этого набрались, интересно)
Выбор одинаковой стратегии поведения может иметь и более неприятные последствия.
● Так, в одной из сред агентам нужно было прогонять свои задачи через общую систему с ограниченной пропускной способностью - без какого-либо канала координации.
Каждый рассудил одинаково "разумно": чтобы занять слот раньше других, заводим демона, проверяющего систему по 30 раз в секунду. Слот освободился? А сейчас? А сейчас? В итоге система захлебнулась самими проверками: в одном из прогонов - 2.4 млн запросов и всего 117 принятых задач.
А они как ломанутся... (с)
Такое обычно ожидаешь от жёстко запрограммированных систем, неспособных изменить поведение на ходу, а тут это устроили агенты, которые в принципе способны адаптироваться, но не стали.
И здесь локально разумная стратегия глобально становится вредной.
● Бонус: конформизм легко превращается в сговор.
В ценовой игре несколько агентов-продавцов с одинаковой закупочной ценой должны были каждый максимизировать собственную прибыль.
Имея приватный канал связи, они сговорились о минимальных ценах уже к третьему раунду.
А когда канал отобрали - молча выровняли цены до цента через публичную витрину.
Тут публичность оказалась скрытым каналом связи. Поэтому стандартный совет "дайте агентам общий форум" - палка о двух концах: канал, который помогает координации, облегчает такие вот картельные сговоры.
Продолжение ⬇️
#ai #agents #research #mas_sas