Группа независимых исследователей (MATS, ELLIS Institute Tübingen, Институт интеллектуальных систем Макса Планка и другие) обнаружила архитектурную дыру в том, как Anthropic, OpenAI и Google защищают цепочки размышлений (chain-of-thought) своих моделей. Провайдеры не хранят «мысли» модели на сервере, а возвращают их клиенту в виде зашифрованного блока, который тот отправляет обратно при следующем запросе. Оказалось, что этот блок полностью взаимозаменяем: его можно подставить в другую сессию, другому пользователю и даже другой, более слабой модели того же провайдера — и она дословно расшифрует чужие рассуждения.
Атака не требует джейлбрейка сильной модели — взламывают промптом слабую «родственную» модель (например, Claude Haiku 4-5 разгадывает трассу Claude Opus 4-8), и защита от дистилляции при этом не срабатывает. Проблема касается всех трёх крупных провайдеров и остаётся неисправленной, несмотря на уведомление лабораторий ещё на рубеже 2025–2026 годов.
- Метод по сути является обфускацией с общим ключом, а не криптографией: блоки рассуждений не привязаны к контексту, сессии или конкретному пользователю
- На 120 задачах Codeforces длина декодированного текста почти точно совпадает с числом скрытых thinking-токенов — восстанавливается практически всё рассуждение, а не фрагменты
- Из 6 708 публичных агентских логов с GitHub и Hugging Face декодировано 315 320 блоков размышлений
- По данным БлоGнот и AI Product, в этих логах найдено 704 приватных артефакта: 62 API-ключа, 33 пароля, 24 токена доступа, 30 личных email; 64 из них не встречались в видимой части сессии вовсе
- По данным Data Secrets и «Навука и моя жизнб», в той же выборке из 315 320 блоков обнаружено 367 артефактов PIIi и 182 учётные записи (цифры расходятся с оценкой других источников)
- Показательный пример: в модель Kimi K3 вставили лишь 1% цепочки рассуждений Opus 4.8, и та, не зная ответа, начала точно воспроизводить продолжение
- Модель может размышлять на запрещённые темы, выдавая безобидный итоговый ответ — фильтры срабатывают только перед выдачей ответа, а не над самим рассуждением
- Исследователи опубликовали статью на arxiv.org/abs/2608.09867 и сайт stolen-thoughts.com, уведомили лаборатории; по их словам, работа по устранению уязвимости ведётся
Провайдеры уведомлены о проблеме ещё на рубеже 2025–2026 годов, но, по словам источников, по состоянию на лето 2026-го уязвимость не устранена ни у одного крупного игрока; авторы работы говорят, что лаборатории ведут работу над исправлением, но сроков патча не называют.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖