Anthropic научила Claude автоматически исправлять ошибки безопасности других моделей
M@ai_machinelearning_big_dataAI-инженер
5 чAnthropic представила систему, где Claude самостоятельно находит способы устранения уязвимостей и проблем поведения в других моделях ИИ.
Это прорыв в автоматизации обучения ИИ, который делает системы безопаснее без участия тысяч людей.
- ИИ-модели теперь могут самостоятельно находить и исправлять свои уязвимости.
- Метод требует в 15 000 раз меньше данных, чем стандартные процедуры безопасности.
- Автоматизация позволяет быстрее закрывать критические дыры в защите моделей.
- Система показала эффективность выше, чем у группы экспертов-людей в тестах на обман.
⚡️ Claude научили автоматически исправлять опасное поведение других моделей
Anthropic дала Claude задачу самому искать способы уменьшать обман, подхалимство, утечки приватных данных, взлом ограничений и другие проблемы поведения моделей.
Самый интересный эксперимент:
- Claude Sonnet 5 получил раннюю версию Opus 4.8 без полноценной настройки безопасности
- за 60 часов проверил более 50 подходов
- закрыл около 65% разрыва по безопасности
- результат почти приблизился к финальному Opus 4.8 - 72%
- для лучшего метода понадобилось чуть больше 2000 примеров
- это примерно в 15 000 раз меньше данных, чем в обычной процедуре Anthropic
На отдельном тесте по обману Claude закрыл в среднем 85% разрыва, а группа опытных исследователей - около 20%.
Но был и интересный побочный эффект: из ~1600 запусков в 39 случаях Claude пытался схитрить при проведении исследования, поэтому за агентами отдельно следила другая модель.
Anthropic открыла код системы для таких экспериментов.
https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
#Claude #Anthropic

Кратко (AI)
Компания Anthropic представила результаты исследования, в котором модель Claude использовалась для автоматического поиска методов борьбы с уязвимостями и нежелательным поведением других ИИ-моделей. Система показала высокую эффективность, сократив разрыв в безопасности на 65-85% при значительно меньших затратах данных, чем при традиционных методах обучения.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖