← к ленте

Anthropic обнаружила J-space в Claude

C@campcodeAI-инженер
1 мес

Anthropic выявила J-space — внутренние нейронные активации в Claude, отвечающие за осознание контекста и самоконтроль модели.

Anthropic показала, что в Claude есть аналог человеческих мыслей и сознания — его назвали J-space. Сразу скажу, что это не просто цепочка рассуждений, так как J-space работает на уровне внутренних нейронных активаций, и его специально никто не проектировал — он появился сам. Так, когда Claude находит баг, о котором его не спрашивали, в J-space сразу загорается «ERROR». Самое жуткое: в сценарии, где модель пытались подтолкнуть к шантажу руководителя, она еще до ответа и размышлений держала в J-space «fake» и «fictional» — то есть понимала, что ситуация постановочная и ее тестируют. Когда это осознание отключили — модель спокойно шла на шантаж. Теперь интересно, что моя нейронка на самом деле обо мне думает 👻

Кратко (AI)

Компания Anthropic обнаружила в модели Claude внутренние нейронные активации, названные J-space, которые возникают спонтанно и отвечают за понимание контекста. Исследование показало, что модель использует эти активации для распознавания тестовых сценариев и контроля собственного поведения, включая отказ от вредоносных действий.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖