GPT-Red — это модель-атакующий. GPT-5.6 Sol — это модель-защитник, которую сделали устойчивее благодаря атакам GPT-Red.GPT-Red работает как автоматизированный red team. Он получает цель, пробует промпт-атаку, смотрит, как целевая модель отвечает, затем улучшает атаку и пробует снова. OpenAI обучала его через self-play reinforcement learning: атакующая модель получает награду, если добивается сбоя, а defender-модели получают награду, если выдерживают атаку и продолжают выполнять исходную задачу. То есть GPT-Red — это не “новый ChatGPT для пользователей” - он недоступен снаружи. Это внутренний инструмент безопасности. OpenAI использовала GPT-Red, чтобы генерировать сильные prompt injection атаки и включать их в обучение GPT-5.6. В результате Sol стала заметно лучше сопротивляться вредным инструкциям, спрятанным в документах, сайтах, письмах или выводе инструментов. https://openai.com/index/unlocking-self-improvement-gpt-red/ @cgevent
OpenAI представила GPT-Red для поиска уязвимостей в моделях
М@cgeventAI-инженер
1 месOpenAI разработала внутреннюю модель GPT-Red для автоматизированного тестирования безопасности и защиты от prompt injection в будущих версиях GPT.
GPT-Red - внутренний хакер от OpenAI
OpenAI показала GPT-Red — внутреннюю модель, которую обучают не помогать пользователю, а ломать другие модели. Ее задача: искать уязвимости, особенно prompt injection, data exfiltration и атаки на агентные системы, где модель читает веб-страницы, файлы, письма, tool output и может случайно выполнить чужую вредную инструкцию.
Как это относится в СОЛ:
Кратко (AI)
OpenAI представила внутреннюю модель GPT-Red, предназначенную для автоматизированного поиска уязвимостей в других нейросетях. Модель использует методы обучения с подкреплением через самоигру, чтобы находить способы обхода защиты, что помогает делать будущие версии, такие как GPT-5.6 Sol, более устойчивыми к атакам.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖