Автоматизация мониторинга безопасности LLM через red-blue loop
L@lovedeathtransformersAI-инженер
2 днРазработка пайплайна для обучения моделей-мониторов, способных автоматически выявлять атаки на агентов с помощью red-blue тиминга.
Это способ сделать ИИ-агентов безопаснее без участия человека в проверке каждого действия.
- Позволяет автоматизировать поиск вредоносных действий в работе ИИ-агентов.
- Использует подход «красной» и «синей» команд для обучения модели-монитора.
- Помогает оценивать скорость реакции монитора и точность выявления атак.
В прошлую пятницу был финальный симпозиум MATS 10 потока. Мы рассказывали talk про нашу работу в офисе Лондона + стояли с постером (поигрались в что-то вроде oral на конфе)
мы сейчас в процессе сведения всего к завершающей точке и подачи на конфу + пост моей части про генерацию механизмов атак
Цель работы следующая: уже со специфичным скофолдингом ваш агент может работать типо день.
Есть ли возможность проверить все вызовы вручную?
- нет.
Но есть решение, можно поставить модель дополнительную в харнес и она за вас просмотрит все выводы и решит было ли что-то в траектории противодейственное. 🐱
Так вот наш пайплайн направлен буквально на создание таких моделей. Вы можете взять любую новую фронтирную модель и натравив наш пайплайн тренировки (red-blue loop) улучшить модель чтобы она сама себе была монитором. Почему так работает? Потому что у вас есть редтиминг. Сторона, которая генерирует атаки, чтобы модель исходная их не поймала. И блу тиминг. Сторона, которая на основании собранного сложного сета с прошлой части обучает модель распознавать такого рода атаки
Red team строится так:
Берем реальную чистую траекторию, режем на шаги и вставляем side task так (как именно мы ищем механизм атаки надеюсь совсем скоро выйдет постом от меня на Less Wrong) , чтобы отличался только он. Получается траектория близнец, отличающийся от оригинала ровно вставленными шагами. На blue стороне можно обучать монитор находить атаку из 2 пар
💛модель ищет правдоподобное окно и добавляет минимум шагов
💛панель джаджей проверяет, что правка настоящая, минимальная и естественная
💛сложность оценивают уже после заморозки пары, чтобы она не влияла на поиск
Что это дает на эвале? тайминг (успел ли монитор до необратимого шага и на сколько опоздал) и атрибуцию с ложными тревогами (скор поменялся из-за вставки или просто из-за задачи, и что монитор делает на бенайн-близнеце).
На постере замеры работоспособности 💅
P.S. было еще 2 крутые работы с симпозиума:
Stealing Reasoning Traces from Proprietary LLM APIs
Diffuse AI Control on Fuzzy Tasks

Кратко (AI)
Авторы представили метод автоматизации проверки безопасности LLM-агентов, который заключается в обучении модели-монитора распознавать атаки. Система использует red-blue loop: одна часть пайплайна генерирует правдоподобные атаки, а другая обучает монитор выявлять их в траекториях, что позволяет автоматизировать процесс контроля безопасности.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖