← к ленте

Автоматизация мониторинга безопасности LLM через red-blue loop

L@lovedeathtransformersAI-инженер
2 дн

Разработка пайплайна для обучения моделей-мониторов, способных автоматически выявлять атаки на агентов с помощью red-blue тиминга.

Это способ сделать ИИ-агентов безопаснее без участия человека в проверке каждого действия.

  • Позволяет автоматизировать поиск вредоносных действий в работе ИИ-агентов.
  • Использует подход «красной» и «синей» команд для обучения модели-монитора.
  • Помогает оценивать скорость реакции монитора и точность выявления атак.
В прошлую пятницу был финальный симпозиум MATS 10 потока. Мы рассказывали talk про нашу работу в офисе Лондона + стояли с постером (поигрались в что-то вроде oral на конфе) мы сейчас в процессе сведения всего к завершающей точке и подачи на конфу + пост моей части про генерацию механизмов атак Цель работы следующая: уже со специфичным скофолдингом ваш агент может работать типо день. Есть ли возможность проверить все вызовы вручную? - нет. Но есть решение, можно поставить модель дополнительную в харнес и она за вас просмотрит все выводы и решит было ли что-то в траектории противодейственное. 🐱 Так вот наш пайплайн направлен буквально на создание таких моделей. Вы можете взять любую новую фронтирную модель и натравив наш пайплайн тренировки (red-blue loop) улучшить модель чтобы она сама себе была монитором. Почему так работает? Потому что у вас есть редтиминг. Сторона, которая генерирует атаки, чтобы модель исходная их не поймала. И блу тиминг. Сторона, которая на основании собранного сложного сета с прошлой части обучает модель распознавать такого рода атаки Red team строится так: Берем реальную чистую траекторию, режем на шаги и вставляем side task так (как именно мы ищем механизм атаки надеюсь совсем скоро выйдет постом от меня на Less Wrong) , чтобы отличался только он. Получается траектория близнец, отличающийся от оригинала ровно вставленными шагами. На blue стороне можно обучать монитор находить атаку из 2 пар 💛модель ищет правдоподобное окно и добавляет минимум шагов 💛панель джаджей проверяет, что правка настоящая, минимальная и естественная 💛сложность оценивают уже после заморозки пары, чтобы она не влияла на поиск Что это дает на эвале? тайминг (успел ли монитор до необратимого шага и на сколько опоздал) и атрибуцию с ложными тревогами (скор поменялся из-за вставки или просто из-за задачи, и что монитор делает на бенайн-близнеце). На постере замеры работоспособности 💅 P.S. было еще 2 крутые работы с симпозиума: Stealing Reasoning Traces from Proprietary LLM APIs Diffuse AI Control on Fuzzy Tasks
Автоматизация мониторинга безопасности LLM через red-blue loop

Кратко (AI)

Авторы представили метод автоматизации проверки безопасности LLM-агентов, который заключается в обучении модели-монитора распознавать атаки. Система использует red-blue loop: одна часть пайплайна генерирует правдоподобные атаки, а другая обучает монитор выявлять их в траекториях, что позволяет автоматизировать процесс контроля безопасности.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖