OpenAI показала GPT-Redi — закрытую (недоступную снаружи) модель, которую обучают не помогать пользователю, а атаковать другие модели, автоматизируя red-teaming безопасности. Её задача — искать уязвимости вроде prompt injectioni, утечки данных (data exfiltration) и атак на агентные системы, где модель читает веб-страницы, файлы, письма и вывод инструментов и может случайно выполнить вредную инструкцию, спрятанную внутри.
GPT-Red обучали через self-play reinforcement learning в паре с моделью-защитником GPT-5.6 Soli: атакующая модель получает награду за успешный срыв работы защитника, а защитник — за то, что выдерживает атаку и продолжает выполнять исходную задачу. В результате такой обкатки GPT-5.6 Sol стала заметно устойчивее к вредным инструкциям, спрятанным в документах, сайтах, письмах и выводе инструментов, что важно для отрасли, где ИИ-системы развиваются быстрее, чем их успевают проверять вручную эксперты по безопасности.
- GPT-Red работает как автоматизированный red team: получает цель, пробует промпт-атаку, анализирует ответ целевой модели, улучшает атаку и повторяет попытку
- Модель нацелена именно на атаки в агентных сценариях — где ИИ читает сторонние файлы, письма, сайты или вывод инструментов и может выполнить вредную инструкцию, скрытую внутри
- GPT-Red — не публичный продукт вроде ChatGPT, а внутренний инструмент безопасности OpenAI
- Способности GPT-Red проверили и в физическом мире: ИИ-хакер взломал торговый автомат в офисе OpenAI
- В одном из ключевых испытаний GPT-Red добился успеха в 84% атак, тогда как специалисты-люди — лишь в 13% попыток
- Подробности OpenAI опубликовала в блоге по адресу openai.com/index/unlocking-self-improvement-gpt-red
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖