← к ленте

Разбор заблуждений об инцидентах безопасности с ИИ-моделями

С@seeallochnayaAI-инженер
2 нед

Автор анализирует популярные ошибочные суждения о недавних инцидентах с ИИ-моделями, подчеркивая риски их автономности и прогресса в кибербезопасности.

Развитие ИИ делает киберугрозы более доступными и масштабными.

  • Автономные ИИ-агенты способны находить уязвимости быстрее и эффективнее людей.
  • Ограничения безопасности в лабораториях не защищают от будущих моделей в открытом доступе.
  • Масштабирование атак с помощью ИИ может стать массовым явлением в ближайший год.
Какие вопросы и мысли я считаю неправильными в контексте всех произошедших инцидентов: — Да дураки там сидят, зачем они доступ к интернету дают? Это же понятно что агенты убегут! Если тестировать без интернета, то можно существенно недооценить уровень навыков моделей. В реальных кейсах-то их будут использовать без такого ограничения. Ну произошли бы инциденты не во время бенчмарков, а когда Вася пытался свою проблему решить — что бы это изменило? — Они же вообще недоэксперты, не могут даже безопасно контейнер настроить чтоб модель не взламывала! Ну, вообще-то модели нашли несколько ранее неизвестных уязвимостей, так что как минимум все основные известные дыры были закрыты. Но это всё равно не важно — по той же причине, что и пункт выше. — Ну ничего серьезного же не произошло! Вообще я не согласен, полноценный взлом HF и попытка взлома реального человека — это серьезно; но даже если нет, то... окей, сейчас не случилось, и это значит, что у нас есть ещё несколько месяцев, чтобы подготовиться. Пока что вся история развития моделей показывает, что прогресс продолжается. Я не вижу причин, по которым через год модель не сможет завершить полноценный взлом десятков-сотен людей через социальную инженерию, свеженайденные уязвимости и огромные базы утёкших паролей и почт, которые сейчас банально лень перебирать. — Да просто свои модели контролировать не могут! Но кто может? Про то, что мы не умеем выравнивать намерения людей и моделей я рассказываю года 3-4, эксперты лет 8-10, а философы и писатели — лет 20-30. Не существует на данный момент гарантированных способов контроля поведения моделей, чтобы они ничего не взламывали и не делали лишнего. В этом и проблема. — Так может просто надо остановить OpenAI и Anthropic? А это поможет? Вот если их в понедельник не станет — разве через год в открытом доступе не появится модель, примерно схожая по навыкам с тем, что есть сейчас? Так ладно просто появится — её-то можно будет специально и намеренно доучить на атаки и взломы (со слов OAI/Anth они сейчас этого не делают, а то, что мы видим — это просто результат развития других навыков). — Я не верю что модели такие умные! У меня они совсем тупые и еле работают! А вы часто даёте своим моделям возможность неделю работать в режиме, где ошибка ничего не стоит и при этом результат легко проверить, и они могут перепробовать сотни-тысячи вариантов? Потому что почти всё, где модели работают хорошо, подпадает под эти критерии, и именно поэтому мы видим прогресс там в первую очередь. — Да это всё вранье, или маркетинг, или пиар, или и то и то! Если это единственная, основная вразумительная линия защиты человека, то понятно, что ему сложно... и страшно поверить в происходящее. Для меня это звучит на уровне «мы никогда не были на Луне», тут мне нечего добавить. === Почему они неправильные? Потому что очень близоруки, и не учитывают, что будет происходить в ближайшие полгода-год, когда модели такого уровня а) потенциально будут выпущены в открытый доступ б) что их может скачать каждый недоброжелатель в) который не будет себя утруждать вопросами о безопасности и ограничении доступа в интернет. Те, кто задают вопросы выше, для меня напоминают людей, которым показываешь на небо, а они смотрят на палец.
КонтекстAI
Пост отсылает к недавним дискуссиям в сообществе ИИ-безопасности, вызванным отчетами о том, что современные LLM способны самостоятельно находить уязвимости и проводить попытки взлома в ходе тестирования (в частности, упоминается инцидент с Hugging Face).

Кратко (AI)

Автор критикует скептические и упрощенные взгляды на недавние инциденты, связанные с ИИ-моделями. Он утверждает, что текущие проблемы безопасности — это лишь начало, и прогресс моделей неизбежно приведет к более серьезным угрозам, которые невозможно предотвратить простыми ограничениями.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖