red-teamingСбросить фильтр ×

Автоматизация мониторинга безопасности LLM через red-blue loop

L@lovedeathtransformersAI-инженер
2 дн
Автоматизация мониторинга безопасности LLM через red-blue loop

Tencent представила платформу AI-Infra-Guard для безопасности AI-инфраструктуры

2 дн
🔥 Tencent открыла AI-Infra-Guard - платформу для red teaming AI-инфраструктуры Инструмент проверяет безопасность практически всего современного AI-стека: * AI-агентов * MCP-серверов * agent skills * AI-инфраструктуры * LLM на jailbreak-атаки В свежей версии добавили защиту от RCE через whitelist инструментов, детект обходов в .pyc, защиту от charset smuggling и расширили базу до 2000+ правил для CVE. Есть отдельные CLI для Agent Scan, MCP Scan и Skill Scan. Разворачивается локально через Docker. https://github.com/tencent/AI-Infra-Guard
Tencent представила платформу AI-Infra-Guard для безопасности AI-инфраструктуры

OpenAI представила GPT-Red — внутреннюю модель-хакера для взлома собственных ИИ-систем

OpenAI показала GPT-Redi — закрытую (недоступную снаружи) модель, которую обучают не помогать пользователю, а атаковать другие модели, автоматизируя red-teaming безопасности. Её задача — искать уязвимости вроде prompt injectioni, утечки данных (data exfiltration) и атак на агентные системы, где модель читает веб-страницы, файлы, письма и вывод инструментов и может случайно выполнить вредную инструкцию, спрятанную внутри.

GPT-Red обучали через self-play reinforcement learning в паре с моделью-защитником GPT-5.6 Soli: атакующая модель получает награду за успешный срыв работы защитника, а защитник — за то, что выдерживает атаку и продолжает выполнять исходную задачу. В результате такой обкатки GPT-5.6 Sol стала заметно устойчивее к вредным инструкциям, спрятанным в документах, сайтах, письмах и выводе инструментов, что важно для отрасли, где ИИ-системы развиваются быстрее, чем их успевают проверять вручную эксперты по безопасности.

ВыводGPT-Red работает как автоматизированный red team: получает цель, пробует промпт-атаку, анализирует ответ целевой модели, улучшает атаку и повторяет попытку

84%успешность атак GPT-Red в тесте
13%успешность атак экспертов-людей в том же тесте

Полный разбор →

Pliny выпустил в опенсорс мультиагентную red-team систему T3MP3ST

Известный исследователь ИИ-джейлбрейкiов Pliny опубликовал в открытом доступе T3MP3STi)">i — мультиагентную систему для автоматического поиска уязвимостей. Пользователю достаточно указать цель: агент сам проводит разведку, ищет дыры в системе и готовит итоговый отчет.

По словам автора, на тестовой выборке из 104 задач по поиску уязвимостей система решила 90% кейсов с первой попытки, что делает её потенциально мощным инструментом для автоматизации пентестинга — как в этичных, так и в неэтичных целях.

90%доля решённых с первой попытки кейсов
104задач в тестовой выборке

Полный разбор →

Это всё на сейчас.