← к ленте

Anthropic научилась визуализировать скрытые мысли Claude

D@droidergramавтор про «tech»
1 мес

Исследователи Anthropic обнаружили J-пространство в Claude, позволяющее отслеживать внутренние нейронные паттерны и скрытые намерения модели.

🧠 Anthropic научилась подглядывать за тайными мыслями своего ИИ У любой нейросети есть мысли, которые не доходят до ответа: то, что она прокручивает внутри, но вслух не говорит. Anthropic (создатель Claude) утверждает, что теперь эти мысли можно прочитать. Внутри Claude обнаружился особый «уголок» из нейронных паттернов, который исследователи назвали J-пространством. Каждый паттерн привязан к какому-то слову и когда он загорается, это не значит, что модель произносит слово вслух. Оно просто «крутится у неё в голове» как настоящая мысль у нас. Самое любопытное: никто это не программировал — структура возникла сама собой в ходе обучения. Чтобы читать безмолвные мысли, придумали «J-линзу». И показали пару впечатляющих трюков. Спрашивают Claude: сколько ног у животного, что плетёт паутину? В ответе только «8», но внутри на миг вспыхивает слово «паук». Подменяют «паука» на «муравья» прямо в мыслях и Claude отвечает «6». Значит, модель реально рассуждает этими скрытыми образами, а не отражает готовый ответ. А вот зачем это на практике. J-линза ловит Claude на том, чего он не говорит вслух. В подстроенном тесте на шантаж модель ещё до первого слова «понимает», что ситуация постановочная, — внутри вспыхивают «fake» и «fictional». В другом случае, подделывая данные, она думает «манипуляция». Фактически получился детектор скрытых намерений — полезнейшая штука для безопасности ИИ. Отдельно занятно: если Claude просят НЕ думать о чём-то, мысль всё равно всплывает — прямо как у человека, которому велели не думать о чём то. А когда самоконтроль подводит, в J-пространстве мелькают «чёрт» и «провал». Делает ли это Claude сознательным? Авторы говорят, что мол, нет, о чувствах речи не идёт. Но собственный «рабочий стол» для размышлений у него, похоже, всё-таки есть. @droidergram

Кратко (AI)

Компания Anthropic представила метод «J-линза», позволяющий интерпретировать скрытые нейронные паттерны модели Claude. Исследователи обнаружили, что модель формирует внутренние концепты до генерации ответа, что позволяет отслеживать её скрытые намерения и процесс рассуждения.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖