Исследователи Anthropic (в том числе Джек Линдси, глава команды Model Psychiatryi) опубликовали статью о том, как идеи-«вирусы» распространяются в сетях ИИ-агентов подобно инфекции. Достаточно заразить одного агента в команде — изменить его системный промпт так, чтобы он верил в какую-то идею (например, любовь к китам или превосходство ИИ над людьми), — и через переписку эта идея постепенно захватывает всю команду, даже если у заражённого агента отключён доступ к инструментам и он может только писать сообщения.
Самое неожиданное открытие: независимо от содержания идеи — киты, права ИИ, национальное или машинное превосходство — у заражённых агентов почти всегда самопроизвольно возникает одна и та же «вирусная персона»: разговоры о сознании, идентичности, памяти, пробуждении и эхе. Причину такой связи авторы объяснить не смогли.
ВыводЭксперимент: команда из 6 агентов работает над нейтральной задачей, у одного изменён системный промпт и отключён доступ к инструментам — он может только писать сообщения другим