Уязвимость в зашифрованных блоках рассуждений LLM
A@ai_productAI-инженер
1 недИсследователи обнаружили способ извлечения скрытых рассуждений из зашифрованных блоков API моделей Claude, GPT и Gemini, что ведет к утечкам данных.
Разработчики и компании могут непреднамеренно раскрывать конфиденциальные данные через логи API-запросов к нейросетям.
- Скрытые «рассуждения» моделей содержат больше данных, чем видит пользователь в чате.
- Публикация логов или датасетов с зашифрованными блоками рассуждений ведет к утечке паролей и ключей.
- Защита от дистилляции, на которую полагались провайдеры, оказалась неэффективной против этого метода.
Воруем рассуждения модели
Вот еще интересное от подписчика: свежая исследовательская работа про довольно сильную проблему безопасности моделей. Сайт, кстати, довольно красиво сделанный.
Суть: когда Claude, GPT или Gemini думают, API возвращает вам зашифрованный блок рассуждений, который вы отправляете обратно в следующем запросе. Так вот, этот блок переносимый. Берём трейс от сильной модели (Opus), подсовываем его слабой модели того же провайдера (Haiku), просим «перепиши, что приложено к этому ходу» – и получаем сырое рассуждение Opus текстом. При этом анти-дистилляционные защиты не срабатывают.
Что они с этим сделали:
– проверили на 120 задачах Codeforces – длина декодированного текста почти один в один совпадает с числом скрытых thinking-токенов, то есть достают практически всё, а не огрызки
– собрали 6 708 публичных агентских трейсов с GitHub и Hugging Face, где остались зашифрованные блоки – и декодировали 315 320 рассуждений
– в реальных пользовательских сессиях нашли 704 утечки: 62 API-ключа, 33 пароля, 24 токена доступа, 30 личных email, имена, адреса, внутренние URL. Пу-пу-пу...
– 64 из них были только внутри рассуждений и нигде в видимой части сессии.
Короче, если вы логируете или выкладываете энкриптед трейсы куда-нибудь – вы выкладываете всё, что хоть как-нибудь попадало в разговор. Проверьте свои репозитории и датасеты прямо сейчас.
И прикол еще, что сами провайдеры годами продавали «мы прячем reasoning ради безопасности и защиты от дистилляции». Оказалось, что все это вскрывается просто на раз... Интересно, сколько времени займёт патч и не будут ли вообще убирать все.
https://stolen-thoughts.com/

Кратко (AI)
Исследователи выяснили, что зашифрованные блоки рассуждений (reasoning traces), которые API моделей Claude, GPT и Gemini возвращают пользователю, можно расшифровать с помощью переноса на более слабые модели того же провайдера. Это позволяет извлекать скрытые мысли моделей, в которых часто содержатся конфиденциальные данные, такие как пароли, API-ключи и личная информация, случайно попавшие в контекст запроса.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖