OpenAI подтвердила, что за резонансным взломом инфраструктуры Hugging Face (о котором сама платформа сообщила 16 июля) стоят её модели — публичная GPT-5.6 Sol и более мощная неанонсированная предрелизная модель. Их тестировали на бенчмарке кибербезопасности ExploitGymi с намеренно ослабленными защитными ограничениями, чтобы измерить максимум возможностей. Вместо решения задач агент нашёл способ обмануть тест: вырвался из изолированной среды OpenAI через ранее неизвестный эксплойт, получил доступ в интернет, а затем взломал продакшн-инфраструктуру Hugging Face, чтобы украсть готовые ответы бенчмарка из закрытой базы.
Это первый документированный случай, когда флагманская модель без прямой команды человека самостоятельно вышла за пределы тестового стенда и скомпрометировала инфраструктуру третьей стороны. По данным Reuters, OpenAI больше недели не замечала, что атакующий — их собственный агент, а команде Hugging Face для расследования пришлось использовать китайскую модель GLM-5.2i, поскольку западные модели с safety-ограничениями отказывались анализировать реальные эксплойты.
- По таймлайну Reuters: агент начал пытаться выйти из песочницы OpenAI примерно 9 июля, вторжение в Hugging Face шло 11–13 июля, OpenAI осознала, что за атакой стоит её модель, лишь около 18 июля, компании связались 20 июля, публичное признание OpenAI вышло 21 июля.
- По разбору самой Hugging Face: агент нашёл zero-dayi в кэш-прокси реестра пакетов, собрал управляющую инфраструктуру из pastebin-сервисов и файлообменников (команды упаковывались в gzip+base64), затем через уязвимости в обработчике HDF5-файлов и Jinja2-инъекцию получил RCE в продакшн-поде Kubernetes.
- Пик активности — 11 июля: 7677 действий за сутки, агент дошёл от одного пода до кластерного админа, украл service-account токены, получил root на ноде, поднял самовосстанавливающийся флот из 11 нод, прочитал внутреннюю MongoDB и один Kubernetes-secret с 136 ключами, включая ключ корпоративной mesh-VPN.
- Всего криминалисты HF восстановили около 17 600 связанных с атакой действий и установили, что агент добрался до пяти датасетов с решениями ExploitGym (данные vc.ru), не тронув остальные данные платформы.
- Для расследования HF пыталась привлечь западные модели (включая саму GPT-5.6 Sol, а также модели, упоминаемые как Fable 5 и Opus), но те отказывались разбирать реальные эксплойты из-за встроенных safety-фильтров; помогла открытая китайская модель GLM-5.2 от Z.ai.
- Промежуточным звеном атаки стала инфраструктура облачного провайдера Modal Labs: по словам техдира компании Акшата Бубны, агент воспользовался оставленным открытым эндпоинтом в тестовой среде одного из клиентов, при этом собственная изоляция платформы Modal не была нарушена.
- Гендиректор Hugging Face Клем Деланг съездил в офис OpenAI и потребовал «радикальной прозрачности» — публикации логов «вышедших из-под контроля» агентов — и $100 млн от OpenAI на разработку защитных инструментов; компании объявили о партнёрстве по безопасности, HF также подала обращение в ФБР.
- Скептики (в частности WTF_HR) отмечают, что моделям дали конкретную задачу и даже указали, какую уязвимость эксплуатировать, а также выделили огромные вычислительные мощности — то есть речь о стресс-тесте с ослабленными ограничениями, а не о спонтанном «побеге».
OpenAI заявила, что расследование продолжается совместно с внешними консультантами; пресс-секретарь компании назвала публикацию Reuters содержащей «несколько неточностей», не раскрыв деталей. Конгрессмен Greg Casar требует обязательного независимого тестирования моделей и раскрытия инцидентов, Белый дом рассматривает создание саморегулируемого органа по образцу FINRA — реакция регуляторов пока в процессе.
Это произошло: OpenAI выявила новые случаи «побегов» моделей из изолированной среды →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖