← к ленте

Исследователи обнаружили уязвимость в механизме скрытых рассуждений ИИ-моделей

C@cyberyozh_officialAI-инженер
2 нед

Исследователи из ELLIS Institute Tübingen и Max Planck Institute доказали, что скрытые рассуждения Claude, Gemini и ChatGPT можно прочитать через младшие модели.

Ваши конфиденциальные данные и логика работы ИИ могут быть доступны третьим лицам из-за ошибки в архитектуре API.

  • Уязвимость позволяет извлекать скрытые мысли моделей, включая пароли и API-ключи, которые не должны быть видны пользователю.
  • Механизм защиты оказался простой обфускацией, а не полноценным шифрованием, что делает данные доступными для чтения младшими моделями.
  • Проблема затрагивает крупнейших игроков рынка и остается неисправленной, создавая риски утечки данных для бизнеса и разработчиков.
⚡️Claude, Gemini и ChatGPT взломали
Скрытые рассуждения читаются силами младших моделей
🔍Обычно внутренние мысли моделей спрятаны за цепочкой рассуждений. Провайдеры уверяют, что скрывают логику работы систем ради защиты интеллектуальной собственности. Но исследователи из ELLIS Institute Tübingen и Max Planck Institute ▶️доказали: вся эта многоуровневая защита имеет уязвимости. Чтобы прочитать зашифрованные рассуждения флагманского ИИ, не нужны сложные взломы. Достаточно взять зашифрованный блок сильной модели, скормить его более дешёвой и менее защищенной сестре из той же линейки - и она выдаст все рассуждения дословно. 🟪Уязвимость подтверждена для API Anthropic, OpenAI и Google:
Вместо того чтобы хранить тяжелые пути рассуждений на собственных защищенных серверах, компании просто возвращают их клиенту в виде зашифрованного текста, который пользователь передает обратно при каждом следующем запросе. Назвать этот механизм шифрованием язык не поворачивается: Блоки полностью взаимозаменяемы между разными сессиями и пользователями. Никакой привязки к конкретному контексту нет.
Это банальная обфускация с общим ключом, а не криптография. 🟡Флагманские модели вроде Claude Opus 4.8 или GPT-5.6 Sol надежно защищены от раскрытия своих мыслей. Но их быстрые и дешевые версии - условные Claude Haiku 4.5 или GPT-5.6 Luna - оптимизированы под скорость и лишены этих ограничений. В итоге младшая модель легко читает мысли старшего собрата.
🟦Проанализировав более 6,7 тысяч публичных датасетов с траекториями агентов, исследователи нашли сотни API-ключей, пароли и персональные данные, которые никогда не показывались пользователю напрямую, но осели в логах. 🟦Модель может рассуждать на запрещенные или вредоносные темы, выдавая на выходе вполне безобидный ответ. Фильтры срабатывают только перед ответом.
Провайдеры были уведомлены об уязвимости еще на рубеже 2025-2026 годов, но по состоянию на лето 2026-го проблема не устранена ни у одного крупного игрока. 🦔CyberYozh
Исследователи обнаружили уязвимость в механизме скрытых рассуждений ИИ-моделей

Кратко (AI)

Исследователи из ELLIS Institute Tübingen и Max Planck Institute выявили уязвимость в API крупных ИИ-провайдеров, позволяющую извлекать скрытые цепочки рассуждений моделей. Оказалось, что данные рассуждения передаются клиенту в виде слабо защищенных блоков, которые могут быть расшифрованы менее защищенными «младшими» моделями из той же линейки. Проблема, о которой компании были уведомлены еще в 2025-2026 годах, остается актуальной по состоянию на лето 2026 года.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖