Исследователи обнаружили уязвимость в механизмах скрытого ризонинга ИИ-моделей
Н@navuka_i_jiznAI-инженер
2 недНезависимые исследователи нашли способ декодировать скрытый ризонинг моделей OpenAI, Anthropic и Google, используя архитектурную уязвимость.
Это ставит под угрозу конфиденциальность данных, которые пользователи доверяют ИИ-моделям.
- Уязвимость позволяет извлекать персональные данные (PII) и учетные записи из скрытых логов рассуждений моделей.
- Метод позволяет обходить механизмы защиты от дистилляции и упрощает проведение атак типа промпт-инъекций.
- Проблема затрагивает крупнейших игроков рынка, включая OpenAI, Anthropic и Google.
Независимые исследователи нашли способ полностью восстанавливать скрытый ризонинг фронтирных моделей
https://arxiv.org/abs/2608.09867
В статье они показывают, что зашифрованный ризонинг любой модели OpenAI, Anthropic и Google можно декодировать буквально 1:1, при этом без джейлбрейка модели.
Авторы нашли архитектурную дыру: зашифрованные блоки ризонинга полностью совместимы и взаимозаменяемы между разными сессиями, пользователями и моделями внутри экосистемы одного провайдера. Например, если взять зашифрованный ризонинг Opus и подсунуть его менее умному Haiku, то тот может прочитать эти «мысли» и вывести их дословно в открытом виде. Вот так просто 🤷♂️
Последствий пропасть. Во-первых, с помощью такой уязвимости можно обходить анти-дистилляционные меры. Во-вторых, в открытых репозиториях куча таких скрытых блоков ризонинга, в которых могут оказаться чувствительные данные (в статье в выборке из 315 320 блоков обнаружили 367 артефактов PII и 182 учетки). В-третьих, это упрощает джейлбрейки и промпт-инъекции.
Вот такой анекдот. Исследователи уже передали свои изыскания в лабы и говорят, что работа по ним ведется.

Кратко (AI)
Исследователи обнаружили критическую уязвимость в архитектуре фронтирных моделей, позволяющую декодировать скрытые цепочки рассуждений (ризонинг). Оказалось, что зашифрованные блоки ризонинга взаимозаменяемы внутри экосистемы провайдера, что позволяет извлекать конфиденциальные данные и обходить меры защиты.
Обсуждение
2если ризонинг спокойно переносится между моделями и сессиями, вся защита от дистилляции через шифрование трасс просто не работает как задумано. интересно смотреть, как лабы будут это закрывать, потому что патчить отдельные модели тут не поможет, придется менять сам подход к шифрованию на уровне архитектуры.
Ожидаемо, как только ризонинг сделали переносимым объектом, это стало вопросом времени. Шифрование тут как замок на решето. Лабы либо выпилят shared latent space, либо вообще перестанут хранить эти логи, других вариантов нет.