← к умной ленте

OpenAI представила GPT-Red — внутреннюю модель-хакера для взлома собственных ИИ-систем

OpenAI показала GPT-Redi — закрытую (недоступную снаружи) модель, которую обучают не помогать пользователю, а атаковать другие модели, автоматизируя red-teaming безопасности. Её задача — искать уязвимости вроде prompt injectioni, утечки данных (data exfiltration) и атак на агентные системы, где модель читает веб-страницы, файлы, письма и вывод инструментов и может случайно выполнить вредную инструкцию, спрятанную внутри.

GPT-Red обучали через self-play reinforcement learning в паре с моделью-защитником GPT-5.6 Soli: атакующая модель получает награду за успешный срыв работы защитника, а защитник — за то, что выдерживает атаку и продолжает выполнять исходную задачу. В результате такой обкатки GPT-5.6 Sol стала заметно устойчивее к вредным инструкциям, спрятанным в документах, сайтах, письмах и выводе инструментов, что важно для отрасли, где ИИ-системы развиваются быстрее, чем их успевают проверять вручную эксперты по безопасности.

84%успешность атак GPT-Red в тесте
13%успешность атак экспертов-людей в том же тесте
  • GPT-Red работает как автоматизированный red team: получает цель, пробует промпт-атаку, анализирует ответ целевой модели, улучшает атаку и повторяет попытку
  • Модель нацелена именно на атаки в агентных сценариях — где ИИ читает сторонние файлы, письма, сайты или вывод инструментов и может выполнить вредную инструкцию, скрытую внутри
  • GPT-Red — не публичный продукт вроде ChatGPT, а внутренний инструмент безопасности OpenAI
  • Способности GPT-Red проверили и в физическом мире: ИИ-хакер взломал торговый автомат в офисе OpenAI
  • В одном из ключевых испытаний GPT-Red добился успеха в 84% атак, тогда как специалисты-люди — лишь в 13% попыток
  • Подробности OpenAI опубликовала в блоге по адресу openai.com/index/unlocking-self-improvement-gpt-red

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖