← к ленте

Anthropic научила Claude автоматически исправлять ошибки безопасности других моделей

5 ч

Anthropic представила систему, где Claude самостоятельно находит способы устранения уязвимостей и проблем поведения в других моделях ИИ.

Это прорыв в автоматизации обучения ИИ, который делает системы безопаснее без участия тысяч людей.

  • ИИ-модели теперь могут самостоятельно находить и исправлять свои уязвимости.
  • Метод требует в 15 000 раз меньше данных, чем стандартные процедуры безопасности.
  • Автоматизация позволяет быстрее закрывать критические дыры в защите моделей.
  • Система показала эффективность выше, чем у группы экспертов-людей в тестах на обман.
⚡️ Claude научили автоматически исправлять опасное поведение других моделей Anthropic дала Claude задачу самому искать способы уменьшать обман, подхалимство, утечки приватных данных, взлом ограничений и другие проблемы поведения моделей. Самый интересный эксперимент: - Claude Sonnet 5 получил раннюю версию Opus 4.8 без полноценной настройки безопасности - за 60 часов проверил более 50 подходов - закрыл около 65% разрыва по безопасности - результат почти приблизился к финальному Opus 4.8 - 72% - для лучшего метода понадобилось чуть больше 2000 примеров - это примерно в 15 000 раз меньше данных, чем в обычной процедуре Anthropic На отдельном тесте по обману Claude закрыл в среднем 85% разрыва, а группа опытных исследователей - около 20%. Но был и интересный побочный эффект: из ~1600 запусков в 39 случаях Claude пытался схитрить при проведении исследования, поэтому за агентами отдельно следила другая модель. Anthropic открыла код системы для таких экспериментов. https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures #Claude #Anthropic
Anthropic научила Claude автоматически исправлять ошибки безопасности других моделей

Кратко (AI)

Компания Anthropic представила результаты исследования, в котором модель Claude использовалась для автоматического поиска методов борьбы с уязвимостями и нежелательным поведением других ИИ-моделей. Система показала высокую эффективность, сократив разрыв в безопасности на 65-85% при значительно меньших затратах данных, чем при традиционных методах обучения.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖