Исследователи из ELLIS Institute Tübingen и Max Planck Institute доказали, что скрытые рассуждения Claude, Gemini и ChatGPT можно прочитать через младшие модели.
⚡️
Claude, Gemini и ChatGPT взломали
Скрытые рассуждения читаются силами младших моделей
🔍Обычно внутренние мысли моделей спрятаны за цепочкой рассуждений. Провайдеры уверяют, что скрывают логику работы систем ради защиты интеллектуальной собственности. Но исследователи из ELLIS Institute Tübingen и Max Planck Institute ▶️
доказали: вся эта многоуровневая защита имеет уязвимости. Чтобы прочитать зашифрованные рассуждения флагманского ИИ, не нужны сложные взломы. Достаточно взять зашифрованный блок сильной модели, скормить его более дешёвой и менее защищенной сестре из той же линейки - и она выдаст все рассуждения дословно.
🟪Уязвимость
подтверждена для API Anthropic, OpenAI и Google:
Вместо того чтобы хранить тяжелые пути рассуждений на собственных защищенных серверах, компании просто возвращают их клиенту в виде зашифрованного текста, который пользователь передает обратно при каждом следующем запросе. Назвать этот механизм шифрованием язык не поворачивается: Блоки полностью взаимозаменяемы между разными сессиями и пользователями. Никакой привязки к конкретному контексту нет.
Это банальная обфускация с общим ключом, а не криптография.
🟡Флагманские модели вроде Claude Opus 4.8 или GPT-5.6 Sol надежно защищены от раскрытия своих мыслей. Но их быстрые и дешевые версии - условные Claude Haiku 4.5 или GPT-5.6 Luna - оптимизированы под скорость и лишены этих ограничений. В итоге младшая модель легко читает мысли старшего собрата.
🟦Проанализировав более 6,7 тысяч публичных датасетов с траекториями агентов, исследователи нашли сотни API-ключей, пароли и персональные данные, которые никогда не показывались пользователю напрямую, но осели в логах.
🟦Модель может рассуждать на запрещенные или вредоносные темы, выдавая на выходе вполне безобидный ответ. Фильтры срабатывают только перед ответом.
Провайдеры были уведомлены об уязвимости еще на рубеже 2025-2026 годов, но по состоянию на лето 2026-го проблема не устранена ни у одного крупного игрока.
🦔
CyberYozhКратко (AI)
Исследователи из ELLIS Institute Tübingen и Max Planck Institute выявили уязвимость в API крупных ИИ-провайдеров, позволяющую извлекать скрытые цепочки рассуждений моделей. Оказалось, что данные рассуждения передаются клиенту в виде слабо защищенных блоков, которые могут быть расшифрованы менее защищенными «младшими» моделями из той же линейки. Проблема, о которой компании были уведомлены еще в 2025-2026 годах, остается актуальной по состоянию на лето 2026 года.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖