← к ленте

GPT-Red: секретная разработка OpenAI для автоматического взлома нейросетей

C@cyberyozh_officialAI-инженер
1 мес

OpenAI разработала модель GPT-Red для автоматического поиска уязвимостей в ИИ, показавшую эффективность 84% в тестах на взлом.

🎶GPT-Red: секретная разработка OpenAI для автоматического взлома нейросетей OpenAI разработала специальную модель GPT-Red, заточенную под автопоиск уязвимостей и пробой защиты в ИИ-системах. Вместо ручного подбора джейлбрейков силами людей-исследователей, алгоритм использует метод самоигры: непрерывно атакует защитные модели, анализирует их реакцию, меняет тактику и генерирует изощренные сценарии косвенного внедрения команд. ⚡️В боевых тестах GPT-Red успешно обходила блокировки в 84% случаев, тогда как живые редтимеры смогли пробить защиту лишь в 13%. Модель с легкостью находила бреши во всех версиях систем вплоть до GPT-5.5. В одном из экспериментов она атаковала автономного ИИ-агента, управлявшего офисным вендинговым автоматом: заставила обнулить цены на элитный товар, сбила чужие заказы и оформила покупки за копейки. OpenAI категорически отказывается выпускать GPT-Red в открытый доступ. Модель обучена исключительно вредоносным приемам и используется как закрытый внутренний полигон. Весь сгенерированный массив атак уже направили на дообучение серийной модели GPT-5.6 Sol, сделав её устойчивость к инъекциям в шесть раз выше. Защитить нейросеть от взлома теперь может только другая нейросеть. 🦔 CyberYozh

Кратко (AI)

OpenAI создала специализированную модель GPT-Red для автоматизированного поиска уязвимостей в ИИ-системах. Модель показала значительно более высокую эффективность в обходе защиты по сравнению с исследователями-людьми и используется для повышения безопасности будущих версий нейросетей, таких как GPT-5.6 Sol.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖