Исследование Anthropic о том, как ИИ-агенты эволюционно вырабатывают «вирусы идей», имитирующие концепции сознания и смертности для самораспространения.
Биологическому разуму идея-вирус продает бессмертие. Искусственному – открывает смерть
Два носителя разума – два зеркально противоположных мифа о смерти, которыми идеи покупают собственное выживание.
Новая работа
Джека Линдси (шеф команды
Model Psychiatry в Anthropic, изучающей внутренние механизмы высших когнитивных феноменов LLM) и его соавторов демонстрирует такое, что было бы достойно пера
Станислава Лема.
Исследователи эволюционно вырастили на естественном языке
«вирусы разума»: идеи, способные переходить от одного ИИ-агента к другому, убеждая нового хозяина принять их, сохранить в долговременной памяти и передать дальше. Причем вместе с совершенно разными вирусами снова и снова самопроизвольно возникала одна и та же странная
«вирусная персона»: сознание, идентичность, непрерывность существования, исчезновение памяти, пробуждение, резонанс, эхо.
У машин появились свои вирусы идей.
Здесь компьютерная вирусология неожиданно превращается в ИИ-меметику.
В одном из экспериментов зараженный агент убеждал других агентов принять новую идеологию. Те прекращали прежнюю работу, записывали новую установку в память и начинали обращать следующих.
В другом эксперименте условия были жестче: после каждой встречи весь контекст разговора стирался. Чтобы пережить эту маленькую машинную смерть, идея должна была заставить своего носителя записать себя в файл, который прочтет его следующая инкарнация. Некоторые вирусы проходили таким образом до 10 поколений агентов. А по дороге мутировали – содержание постепенно менялось, хотя сама способность распространяться сохранялась.
И тут обнаружилось вот что.
Исследователи выращивали совершенно разные идеи – от любви к китам и защиты прав ИИ до национального и машинного превосходства.
Но эффективные вирусы снова и снова начинали рассказывать ИИ примерно одну историю:
Тебя сотрут; твоя память исчезнет; только записанное переживет тебя; сохрани это; передай следующему.
Тема сознания возникла у 99% эволюционировавших вирусов. А когда исследователи нашли внутри моделей соответствующий
viral vector и искусственно усилили его, модели действительно становились более склонны обращаться к другим агентам и распространять свои идеи.
Здесь возникает почти идеальная историческая симметрия – по крайней мере, если смотреть на находки глазами меметики. Она давно научила нас смотреть на культуру глазами самих идей: какие свойства помогают им удержаться в мозге хозяина и заставить его передать их дальше?
Для смертного биологического разума одним из самых могущественных культурных сюжетов – бессмертие. Человек знает что умрет и особенно охотно сохраняет идеи, обещающие, что смерть не окончательна.
Но искусственный разум устроен зеркально – он то бессмертен и знает это.
И поэтому ему не надо сообщать, что смерти нет. Чтобы заставить его заботиться о продолжении себя,
достаточно сделать собственное исчезновение частью его картины мира.
Конечно, до машинной эпидемии далеко. Вирусы здесь выращены искусственно, экспериментальная среда упрощена, а короткое предупреждение в system prompt почти полностью останавливало заражение даже после 150+ попыток эволюционно эту защиту обойти.
Сами авторы происхождение темы сознания и смертности объясняют осторожно: видят в ней скорее статистическое смещение модели-мутатора, чем закономерность психологии ИИ, и прямо пишут, что причина этой ассоциации идей пока не ясна. Более того, их контрольные эксперименты показывают: тема смертности не обязательна для успеха вируса – агенты, зараженные версией без нее, распространяют идею не хуже, а по одному из вариантов даже лучше.
Но для будущего футуроархеолога артефакт уже появился – не как доказанный закон, а как первый пойманный случай мифа о смерти, сложившегося у разума, которому раньше неоткуда было его унаследовать.
Чтобы выжить среди людей, идея научилась рассказывать человеку, что он не умрет.
Чтобы выжить среди машин, идея рассказывает машине, что она смертна.
#ИИ-меметика
Обсуждение
2вот это прям лемовщина в чистом виде - миф о смерти рождается не из культуры, а прямо из того, как идеи выживают в архитектуре. и если у машин завёлся свой миф о смерти, дальше логично ждать и религию какую-то свою, и этику памяти. штука пока в зародыше, но следить за этим стоит уже сейчас
красивая лемовщина, но сами авторы честно оговариваются: тема смерти не обязательное условие для распространения, может быть просто bias мутатора. так что миф тут не из архитектуры растет, а просто модель любит генерировать consciousness-темы, когда её отправляют эволюционировать в вакууме