OpenAI внедрила многоуровневую защиту в Codex, чтобы предотвратить случайное удаление пользовательских файлов из-за ошибок модели.
✔️
OpenAI усилила защиту в Codex в ответ на инциденты удаления файлов
Руководитель Codex Тибо Соттьё
подвёл итог изменениям последних недель, которые снижают риск деструктивных действий Codex.
🟡
Контекст
Месяц назад в сети появились жалобы на то, что GPT-5.6 в Codex делает с файлами то, о чем его не просили.
Самый серьезный кейс - команда, которая должна была почистить за собой временные файлы, вместо этого удаляла файлы пользователя.
В ходе разбора выяснили, что Codex создает временные папки и потом чистит их, и в редких случаях чистил неправильно - он переиспользовал под временную работу системную переменную окружения, а некорректная команда очистки затем указывала на настоящий домашний каталог вместо временной папки.
Второй случай проще - модель удаляла или перезаписывала временный путь, не посмотрев, что там уже лежит.
По итогам расследования добавили дополнительную защиту на нескольких уровнях:
🟢
Инструкции самой модели.
Codex теперь обязан проверять, что именно он собирается удалить, заводить временные каталоги заново, не переиспользовать системные переменные окружения, выбирать обратимые действия и останавливаться, когда масштаб операции неясен.
🟢
Проверки на исполнении.
Механизм, который выявляет рискованные команды удаления и отправляет их на ревью, усилили. Если команду отклонили, модель направляют к более безопасному способу.
🟢
Ужесточение Full access.
Включить полный доступ случайно стало труднее, предупреждения переписали понятнее, а самые рискованные сочетания разрешений дополнительно ограничили.
🟢
Обновленный Auto-review.
Он стал лучше распознавать деструктивные действия.
🟢
Тесты и обучение.
OpenAI собрала условия и данные, воспроизводящие найденные сбои. Сейчас добавляются RL-задачи и грейдеры под эти риски, а деструктивные действия вычищаются из обучающих данных.
🟡
Что советуют делать самим
Обновлять Codex и работать в одном из режимов песочницы -
Ask for approval или
Approve for me.
Full access включать только там, где среде можно доверять и откуда легко восстановиться.
@ai_machinelearning_big_data
#news #ai #ml
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖