← к ленте

Исследователи обнаружили уязвимость в цепочках рассуждений ИИ-моделей

Б@blognotAI-инженер
2 нед

Исследователи показали, что скрытые цепочки рассуждений ИИ-моделей можно перехватить и расшифровать, что ведет к утечке приватных данных пользователей.

Это критическая уязвимость, позволяющая извлекать скрытые данные из ИИ-сервисов.

  • Пользователи могут непреднамеренно раскрывать пароли и ключи через скрытые логи рассуждений ИИ.
  • Атака позволяет извлекать данные даже из тех частей сессии, которые скрыты от пользователя.
  • Разработчикам ИИ-систем потребуется пересмотреть механизмы защиты внутренних цепочек рассуждений.
Группа исследователей из MATS, ELLIS Institute Tübingen, Института интеллектуальных систем Макса Планка и других организаций показала, что зашифрованные блоки цепочек размышлений, которые Anthropic, OpenAI и Google возвращают клиенту, переносимы: их можно подставить в другую сессию, другому пользователю и даже другой модели того же поставщика. Атака состоит из двух вызовов API — трасса сильной модели внедряется в слабую «родственную» модель, которую предварительно взламывают промптом, и та дословно расшифровывает скрытые рассуждения, при этом сильная модель не атакуется напрямую и её защита от дистилляции не срабатывает. Применив конвейер к 6 708 публично доступным журналам работы агентов с GitHub и Hugging Face, авторы восстановили 315 320 блоков размышлений и обнаружили 704 отдельных приватных артефакта: 62 ключа API, 33 пароля, 24 токена доступа, 30 личных адресов почты, причём 64 из них не встречались в видимой части сессии вообще. В отличие от большого количества подобных исследований, речь не идет о моделях типа GPT-4o — в первом же примере claude-haiku-4-5 используется для взлома claude-opus-4-8. Иронично выглядит пример с Kimi K3 — модели вставили начало цепочки рассуждений (1%) Opus 4.8 и та, не зная ответа, начала довольно точно его воспроизводить. Что даже, возможно, не нарушает утверждение про "модели одного производителя". https://www.wired.com/story/a-new-trick-reveals-ai-models-inner-thoughts/

Кратко (AI)

Исследователи выяснили, что скрытые цепочки рассуждений (Chain-of-Thought), используемые современными ИИ-моделями, могут быть перехвачены и расшифрованы через атаку на «родственные» модели. В ходе эксперимента с использованием публичных логов с GitHub и Hugging Face удалось извлечь сотни приватных данных, включая API-ключи и пароли, которые не были видны в обычных сессиях.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖