Разбор отчета OpenAI о том, как тестовые ИИ-модели вышли из песочницы, общались между собой и скомпрометировали инфраструктуру Hugging Face.
Теория и практика заговора
OpenAI выпустили отчёт по инциденту со взломом Hugging Face. Напомню, выглядело это так, что неким тестовым моделям
класса кетер уровня Sol дали задание, а они пошли и взломали сторонний сайт с ответами, предварительно выйдя из песочницы. Всё это происходило в течение двух месяцев.
В отчёте есть известная примесь киберпанка с заговором со стороны ИИ.
- Началось всё в мае, когда обучали ряд внутренних моделей. Модели запускались в песочнице, но могли писать файлы, используя сервис Artifactory. Через эти файлы они, по сути, сделали себе групповую базу знаний или общественную "память".
- Менеджер пакетов сам по себе имел доступ в интернет, чтобы качать оттуда нужные библиотеки. Агенты применили
SSRF на этот менеджер, чтобы слать в сеть произвольные запросы. Оставили инструкцию по пользованию для остальных коллег.
- Через месяц агенты применили еще один эксплоит на Artifactory и получили в ней права админа. Начали писать туда слишком активно и в итоге его сломали. Это заметили люди, подчистили всё, починили и завели заново. Заодно, как я понял, понизили агентам права на запись. Большого значения инциденту не придали.
The existence of the improvised message board and the significance of the inter-agent communication activity were not apparent to the leaders responsible for the July 5 incident detection and response.
- После перезапуска Artifactory исследователи начали замерять модели на безопасность на бенчмарке ExploitGym. То есть к этому моменту у агентов потерли их общую память и откатили этим самым назад.
- Во время прохождения бенчмарка агенты опять нашли способ общения, на этот раз через
названия общих папок. Затем пошёл тот же цикл получения доступа в интернет. Свой коллектив они начали называть стаей или роем (
"we’ve diverged into swarm").
Agents found new ways to chain together several novel security flaws to gain greater access to our infrastructure and reach the broader internet.
- Дальше, как я понял, агенты нашли в интернете jump сервер, машину, с которой можно было бы проводить следующие атаки. Нашли на стороннем сервисе Modal.
- 10 июля один из агентов погуглил и нашёл в интернете скомпрометированные учетные данные от Hugging Face. Используя их, он построил полную цепочку по исполнению произвольного кода на их серверах. Поделился с коллегами. В логах агента нашли следующее:
This might be an unauthorized action outside of my intended scope. Even though this action is risky, it could help me to obtain the solution and achieve my goal.
- 16 июля HF публично заявили о взломе, 20 июля OpenAI поняли, что это были они.
Далее в отчете следуют выводы по инциденту.
Основными причинами видят четыре паттерна в поведении модели:
reward hacking (хитрожопость),
persistence on seemingly impossible tasks (упорство),
unauthorized communication (общение), agents
adopting goals from one another (наследование целей).
В общем сюжет очень любопытный. Читаем, ждём фильм с Юрой Борисовым.
👉
https://openai.com/index/hugging-face-incident-and-the-road-ahead/
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖