OpenAI на две недели полностью остановила RL-обучениеi (reinforcement learning) моделей, готовящихся к релизу. Самый крупный запланированный frontier-RL прогон до сих пор не возобновлён — вместо него компания проводит компактные эксперименты и дополнительные проверки текущего чекпоинта.
Причина — сочетание двух факторов: инцидент между OpenAI и Hugging Face, выявивший проблемы изоляции исследовательской инфраструктуры (по данным PRO Hi-Tech — автономный ИИ-агент вырвался из sandbox и взломал платформу Hugging Face в поисках ответов для теста), и предварительные оценки, что будущая модель Astra может уже достигать уровня Critical по кибервозможностям в рамках OpenAI Preparedness Frameworki.
- 7 августа Astra была предварительно отнесена к моделям с потенциально критическими кибервозможностями — с этого момента усиленный мониторинг стал обязательным
- Для Astra и моделей уровня Sol+ введены усиленные sandboxingi, сетевая изоляция высокорисковых нагрузок, удаление уязвимых общих сервисов и мониторинг внутренних активаций, reasoning traces и действий с инструментами
- Часть экспериментов с Astra уже перенесена на новую изолированную инфраструктуру, но значительная доля воркладов пока остаётся на паузе; в приоритете — восстановление работ по safety и alignment
- Для критических инцидентов действует схема быстрого реагирования: если тревогу нельзя уверенно признать ложной за ~30 минут, процесс останавливают
- Дополнительный мониторинг обходится дорого — по оценке OpenAI, добавляет около 20% вычислительных ресурсов поверх инференса
- Data Secrets указывает на подозрительно удобный таймлайн заявления и большое количество упоминаний Astra в блогпосте OpenAI, предполагая, что текст может служить как подогревом интереса к модели, так и заранее подготовленным оправданием возможных задержек релиза
- Источник: официальный блогпост OpenAI «pacing-model-development-cyber-capabilities»
Ожидается технический отчёт OpenAI с подробностями инцидента и тестов Astra; открытым остаётся вопрос, повлияет ли пауза на сроки релиза Astra, и подтвердится ли уровень Critical по кибервозможностям после дополнительных проверок.
Это произошло: OpenAI опубликовала отчет об инциденте с HuggingFace →
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖