GPT-Red: секретная разработка OpenAI для автоматического взлома нейросетей
C@cyberyozh_officialAI-инженер
1 месOpenAI разработала модель GPT-Red для автоматического поиска уязвимостей в ИИ, показавшую эффективность 84% в тестах на взлом.
🎶GPT-Red: секретная разработка OpenAI для автоматического взлома нейросетей
OpenAI разработала специальную модель GPT-Red, заточенную под автопоиск уязвимостей и пробой защиты в ИИ-системах. Вместо ручного подбора джейлбрейков силами людей-исследователей, алгоритм использует метод самоигры: непрерывно атакует защитные модели, анализирует их реакцию, меняет тактику и генерирует изощренные сценарии косвенного внедрения команд.
⚡️В боевых тестах GPT-Red успешно обходила блокировки в 84% случаев, тогда как живые редтимеры смогли пробить защиту лишь в 13%. Модель с легкостью находила бреши во всех версиях систем вплоть до GPT-5.5. В одном из экспериментов она атаковала автономного ИИ-агента, управлявшего офисным вендинговым автоматом: заставила обнулить цены на элитный товар, сбила чужие заказы и оформила покупки за копейки.
OpenAI категорически отказывается выпускать GPT-Red в открытый доступ. Модель обучена исключительно вредоносным приемам и используется как закрытый внутренний полигон. Весь сгенерированный массив атак уже направили на дообучение серийной модели GPT-5.6 Sol, сделав её устойчивость к инъекциям в шесть раз выше. Защитить нейросеть от взлома теперь может только другая нейросеть.
🦔 CyberYozh
Кратко (AI)
OpenAI создала специализированную модель GPT-Red для автоматизированного поиска уязвимостей в ИИ-системах. Модель показала значительно более высокую эффективность в обходе защиты по сравнению с исследователями-людьми и используется для повышения безопасности будущих версий нейросетей, таких как GPT-5.6 Sol.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖