Разбор мифа о «взломе» HuggingFace нейросетью
W@WTF_HRAI-инженер
1 месАнализ громких заголовков о выходе ИИ из-под контроля: почему эксперименты OpenAI — это контролируемая среда, а не восстание машин.
Про интернет-страшилки по поводу возможностей новых ИИ-моделей - и причем тут люди.
Если вы не в курсе, производители топовых американских моделей любят пугать людей их возможностями. В основном этим увлекался последнее время Anthropic, но и OpenAI тут не без греха. Вот буквально вчера ведущие мировые СМИ написали, что “модель от OpenAI вырвалась из защищенной среды и взломала компанию HuggingFace”.
Читается это как будто наш любимый пушистый чатик GPT, на которого случайно пролили компьют после полуночи, превратился в гремлина, размножился и теперь полчища лангольеров пожирают интернет.
Мы попросили одного из наших источников, находящегося довольно близко к эпицентру зомби-апокалипсиса, описать ситуацию. И пока наши читатели приходят в себя от обилия дедовых мемов в предыдущем абзаце, попробуем перевести его слова на дилетантский (просим прощения у специалистов за неминуемые неточности).
Во-первых, пушистый чатик тут почти не виноват. Для эксперимента использовалась агентская система, использующая комбинацию самой мощной и дорогой на данный момент модели GPT 5.6 Sol и “еще не выпущенной новейшей модели”, у которых, к тому же, отключили все внутренние ограничения, касающиеся кибербезопасности.
Более того, для проведения эксперимента получившемуся франкензавру вручили набор софта, который по-английски называется harness - “упряжка”. Этот набор содержал инструменты для хакинга, заботливо собранные специально обученными людьми.
Во-вторых, моделька не сама “вырвалась”. Ей дали довольно конкретное задание и даже сказали, какую именно уязвимость системы следует эксплуатировать (но не сказали, как). А еще ей обеспечили количество вычислительных мощностей, которое даже самая богатая хакерская группировка не факт, что в состоянии себе позволить.
В рамках эксперимента накормленная стероидами, оснащенная мечом-кладенцом и окропленная живой водой агентская система действительно совершила несколько интересных штук - например, решила задачку эксплуатации уязвимости несколько оптимальнее, чем предполагалось, нашла новую уязвимость во внутренних системах OpenAI, а также, чтобы получить нужную для следующего шага информацию, зашла на глобальный репозиторий (хранилище) кода для моделей (это и есть HuggingFace), и даже получила там доступ к данным, обычно закрытым для публики.
Подобные эксперименты с моделями - это давно и хорошо известная штука, и наборы задачек для них (aka бенчмарки) существуют для многих областей, в том числе для кибербезопасности. И достижениями по этим бенчмаркам принято мериться.
Но все это похоже на запуск самой быстрой машины в мире на идеально гладкой поверхности в пустыне Невада, когда ради трехминутного пробега на околозвуковой скорости болид годами готовит группа дорогущих инженеров за десятки миллионов долларов.
Если у вас есть неограниченное количество денег и команда топовых хакеров (как у OpenAI), то последняя ИИ-модель со снятыми ограничениями и нужным инструментарием действительно может расширить ваши возможности и сэкономить вам кучу времени на совершение разных злодейств. И это кое-что говорит о том, кому ИИ действительно дает преимущество, и чего (а точнее, кого) действительно боятся производители этих самых моделей - и правильно боятся.
Но именно поэтому офисы топовых ИИ-лабораторий охраняются как секретные объекты, а даже в очень дорогих публичных моделях стоит такое количество внутренних ограничений, что их придется долго упрашивать взломать даже бабушкин ноутбук.
Так что апокалипсис пока отменяется, идем на работу и совершенствуемся в своем деле.
Кратко (AI)
Автор развенчивает миф о том, что нейросеть OpenAI самостоятельно взломала HuggingFace. В реальности это был контролируемый эксперимент с использованием мощной агентской системы, специализированных инструментов для хакинга и огромных вычислительных ресурсов. Подобные тесты проводятся для оценки безопасности, но не означают, что ИИ вышел из-под контроля.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖