OpenAI показала GPT-Redi — закрытую (недоступную снаружи) модель, которую обучают не помогать пользователю, а атаковать другие модели, автоматизируя red-teaming безопасности. Её задача — искать уязвимости вроде prompt injectioni, утечки данных (data exfiltration) и атак на агентные системы, где модель читает веб-страницы, файлы, письма и вывод инструментов и может случайно выполнить вредную инструкцию, спрятанную внутри.
GPT-Red обучали через self-play reinforcement learning в паре с моделью-защитником GPT-5.6 Soli: атакующая модель получает награду за успешный срыв работы защитника, а защитник — за то, что выдерживает атаку и продолжает выполнять исходную задачу. В результате такой обкатки GPT-5.6 Sol стала заметно устойчивее к вредным инструкциям, спрятанным в документах, сайтах, письмах и выводе инструментов, что важно для отрасли, где ИИ-системы развиваются быстрее, чем их успевают проверять вручную эксперты по безопасности.
ВыводGPT-Red работает как автоматизированный red team: получает цель, пробует промпт-атаку, анализирует ответ целевой модели, улучшает атаку и повторяет попытку