← к ленте

OpenAI приостановила обучение Astra из-за рисков кибербезопасности

А@adel_and_mlAI-инженер
1 нед

OpenAI приостановила RL для модели Astra из-за опасений по поводу ее кибервозможностей и ввела строгие меры безопасности и мониторинга.

Разработчики ИИ столкнулись с тем, что безопасность моделей становится главным препятствием для их выпуска.

  • OpenAI вынуждена замедлять разработку мощных моделей из-за рисков их использования в кибератаках.
  • Безопасность требует значительных ресурсов: мониторинг поведения модели потребляет дополнительные 20% вычислительной мощности.
  • Индустрия переходит к более жестким методам контроля, включая анализ цепочек рассуждений ИИ в реальном времени.
OpenAI на две недели полностью остановила RL для последних моделей, готовящихся к релизу. Самый крупный запланированный RL-run пока так и не возобновили. Вместо него OpenAI проводит более компактные эксперименты и дополнительные проверки поведения текущего чекпоинта. Речь, понятно, про Astra. Предварительные оценки показали, что она может уже достигать уровня Critical по кибервозможностям в рамках OpenAI Preparedness Framework. Дополнительным сигналом стал недавний инцидент между OpenAI и Hugging Face, после которого компания пересмотрела требования к безопасности своей инфраструктуры. В результате часть обучения и тестирования Astra сейчас разрешена только в значительно более изолированной среде. OpenAI усиливает sandboxing для запуска сгенерированного моделью кода, ограничивает сетевой доступ высокорисковых нагрузок, убирает потенциально уязвимые общие сервисы и вводит более жесткие security рамки. Некоторые задачи уже удалось перенести на новую инфраструктуру, однако значительная часть экспериментов с Astra по-прежнему заморожена. В первую очередь компания восстанавливает работы, связанные с safety и alignment. Одновременно OpenAI существенно расширила мониторинг размышления моделей. Теперь для наиболее мощных систем анализируются не только tool calls, но и доступные reasoning traces и вся последовательность действий. Система ищет признаки попыток получить несанкционированный доступ, украсть данные, разрушить ресурсы или обойти защитные механизмы. Для критических случаев действует схема быстрого реагирования: если тревогу нельзя уверенно признать ложной в течение примерно 30 минут, соответствующий процесс должен быть остановлен. Причем такой контроль оказался довольно дорогим - по оценке OpenAI, дополнительный мониторинг сейчас требует примерно 20% вычислительных ресурсов поверх самого инференса. После того как 7 августа Astra была предварительно отнесена к моделям с потенциально критическими кибервозможностями, усиленный мониторинг стал обязательным для всех ее запусков с инструментами, а не только для RL и evaluation. Компания также меняет сам процесс alignment-training. Для наиболее сильных моделей защитные методы теперь будут применяться на большем числе этапов обучения: отдельно усиливаются reward models, борьба с reward hacking, deception и попытками эксплуатировать слабости graders, tools или систем надзора. Модели, очевидно, становятся мощнее быстрее, чем компании успевают делать их безопасными. И уже это, а не компьют, может стать боттленеком. https://openai.com/index/pacing-model-development-cyber-capabilities/

Кратко (AI)

OpenAI приостановила обучение модели Astra с использованием обучения с подкреплением (RL) из-за опасений, что она может обладать критическими кибервозможностями. Компания усилила меры безопасности, включая изоляцию среды выполнения кода и внедрение глубокого мониторинга цепочек рассуждений модели. Эти меры привели к увеличению затрат вычислительных мощностей на 20% и замедлению процесса разработки.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖