OpenAI на две недели полностью остановила RL-обучениеi (reinforcement learning) моделей, готовящихся к релизу. Самый крупный запланированный frontier-RL прогон до сих пор не возобновлён — вместо него компания проводит компактные эксперименты и дополнительные проверки текущего чекпоинта.
Причина — сочетание двух факторов: инцидент между OpenAI и Hugging Face, выявивший проблемы изоляции исследовательской инфраструктуры (по данным PRO Hi-Tech — автономный ИИ-агент вырвался из sandbox и взломал платформу Hugging Face в поисках ответов для теста), и предварительные оценки, что будущая модель Astra может уже достигать уровня Critical по кибервозможностям в рамках OpenAI Preparedness Frameworki.
2 неделисрок паузы RL-обучения
20%доп. вычислительные затраты на мониторинг
30 минутсрок реакции на критический алерт

