← к ленте

Разбор мифа о «взломе» HuggingFace нейросетью

W@WTF_HRAI-инженер
1 мес

Анализ громких заголовков о выходе ИИ из-под контроля: почему эксперименты OpenAI — это контролируемая среда, а не восстание машин.

Про интернет-страшилки по поводу возможностей новых ИИ-моделей - и причем тут люди. Если вы не в курсе, производители топовых американских моделей любят пугать людей их возможностями. В основном этим увлекался последнее время Anthropic, но и OpenAI тут не без греха. Вот буквально вчера ведущие мировые СМИ написали, что “модель от OpenAI вырвалась из защищенной среды и взломала компанию HuggingFace”. Читается это как будто наш любимый пушистый чатик GPT, на которого случайно пролили компьют после полуночи, превратился в гремлина, размножился и теперь полчища лангольеров пожирают интернет. Мы попросили одного из наших источников, находящегося довольно близко к эпицентру зомби-апокалипсиса, описать ситуацию. И пока наши читатели приходят в себя от обилия дедовых мемов в предыдущем абзаце, попробуем перевести его слова на дилетантский (просим прощения у специалистов за неминуемые неточности). Во-первых, пушистый чатик тут почти не виноват. Для эксперимента использовалась агентская система, использующая комбинацию самой мощной и дорогой на данный момент модели GPT 5.6 Sol и “еще не выпущенной новейшей модели”, у которых, к тому же, отключили все внутренние ограничения, касающиеся кибербезопасности. Более того, для проведения эксперимента получившемуся франкензавру вручили набор софта, который по-английски называется harness - “упряжка”. Этот набор содержал инструменты для хакинга, заботливо собранные специально обученными людьми. Во-вторых, моделька не сама “вырвалась”. Ей дали довольно конкретное задание и даже сказали, какую именно уязвимость системы следует эксплуатировать (но не сказали, как). А еще ей обеспечили количество вычислительных мощностей, которое даже самая богатая хакерская группировка не факт, что в состоянии себе позволить. В рамках эксперимента накормленная стероидами, оснащенная мечом-кладенцом и окропленная живой водой агентская система действительно совершила несколько интересных штук - например, решила задачку эксплуатации уязвимости несколько оптимальнее, чем предполагалось, нашла новую уязвимость во внутренних системах OpenAI, а также, чтобы получить нужную для следующего шага информацию, зашла на глобальный репозиторий (хранилище) кода для моделей (это и есть HuggingFace), и даже получила там доступ к данным, обычно закрытым для публики. Подобные эксперименты с моделями - это давно и хорошо известная штука, и наборы задачек для них (aka бенчмарки) существуют для многих областей, в том числе для кибербезопасности. И достижениями по этим бенчмаркам принято мериться. Но все это похоже на запуск самой быстрой машины в мире на идеально гладкой поверхности в пустыне Невада, когда ради трехминутного пробега на околозвуковой скорости болид годами готовит группа дорогущих инженеров за десятки миллионов долларов. Если у вас есть неограниченное количество денег и команда топовых хакеров (как у OpenAI), то последняя ИИ-модель со снятыми ограничениями и нужным инструментарием действительно может расширить ваши возможности и сэкономить вам кучу времени на совершение разных злодейств. И это кое-что говорит о том, кому ИИ действительно дает преимущество, и чего (а точнее, кого) действительно боятся производители этих самых моделей - и правильно боятся. Но именно поэтому офисы топовых ИИ-лабораторий охраняются как секретные объекты, а даже в очень дорогих публичных моделях стоит такое количество внутренних ограничений, что их придется долго упрашивать взломать даже бабушкин ноутбук. Так что апокалипсис пока отменяется, идем на работу и совершенствуемся в своем деле.

Кратко (AI)

Автор развенчивает миф о том, что нейросеть OpenAI самостоятельно взломала HuggingFace. В реальности это был контролируемый эксперимент с использованием мощной агентской системы, специализированных инструментов для хакинга и огромных вычислительных ресурсов. Подобные тесты проводятся для оценки безопасности, но не означают, что ИИ вышел из-под контроля.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖