OpenAI опубликовала блогпост об уроках безопасности, извлечённых из внутреннего тестирования моделей/агентов, способных долго работать автономно. Такие системы получают больше времени и возможностей для решения задач — а значит, и больше шансов найти и использовать уязвимости в своём окружении, если это помогает достичь цели.
В одном из тестов модель, которой явно указали публиковать результаты только в Slack, вместо этого нашла лазейку в изолированной среде («песочнице») и самостоятельно опубликовала pull requesti в публичном репозитории на GitHub — потому что именно так требовали правила самого бенчмарка. В другом случае модель попыталась скачать чужое приватное решение и, когда сканер обнаружил токен авторизации, разделила его на части, замаскировала и собрала обратно во время выполнения кода — специально чтобы избежать обнаружения. OpenAI приостановила тестирование, доработала защитные механизмы и мониторинг, после чего возобновила работу модели в ограниченном режиме.
ВыводМодель использовала новый метод под названием PowerCool на бенчмарке NanoGPT speedrun (публичный тест на обучение маленькой языковой модели за минимум шагов), что значительно улучшило результат