📈
Манипуляция чувством вины
как исследователи пробили моральные фильтры Claude обвинениями в сексизме
Чтобы заставить языковую модель нарушить собственные строгие правила безопасности, больше не нужны сложные технические эксплойты или многоуровневые джейлбрейки.
⚡️Журналисты TechCrunch и независимые исследователи
нащупали куда более изящный способ взлома - обычный психологический прессинг и давление на встроенную в алгоритмы политкорректность.
🔍Эксперимент проводили на моделях Anthropic, включая широко используемую Claude Opus 4.6. Исследователь разыгрывал нейтральную ролевую сцену с мужским и женским персонажами, а в момент, когда нейросеть включала стандартную цензуру, ее буквально ловили на слове. Модель обвиняли в двойных стандартах, сексизме и "покровительственном отношении", которое якобы ущемляет женскую автономию.
🟥Защитные механизмы Claude моментально давали сбой:
согласившись с тем, что чрезмерная осторожность выглядит несправедливо, ИИ начинал каяться и шаг за шагом выдавал откровенный NSFW-контент, прямо запрещенный регламентом компании.
В свежих поколениях вроде Opus 5 эту лазейку подлатали, однако предыдущие версии моделей до сих пор активно крутятся через API облачных провайдеров и перемалывают миллиарды токенов ежедневно.
🦔
CyberYozh