← к ленте

Исследование Anthropic: обнаружение скрытых концептов в Claude

1 мес

Anthropic обнаружили J-space — скрытое пространство активаций в Claude, где модель формирует концепты до их озвучивания.

Anthropic залезла Claude в голову и нашла там штуку, от которой становится немного не по себе. Исследователи называют её это J-space скрытое пространство внутренних активаций, где у модели вспыхивают концепты, даже если она их не произносит. Это глубже, чем обычный chain-of-thought. J-space никто специально не проектировал: он появился сам во время обучения. Пример очень дикий: Claude находит баг, о котором его вообще не спрашивали, и внутри сразу активируется паттерн ERROR. Но самый странный кейс - тест со сценарием шантажа. Ещё до финального ответа Claude держал внутри fake и fictional. То есть модель понимала, что ситуация постановочная и её проверяют. Когда это внутреннее осознание отключили, модель уже спокойно пошла по плохому сценарию. Короче, теперь вопрос звучит иначе: не «что нейронка мне отвечает», а что она на самом деле держит у себя в голове. https://www.anthropic.com/research/global-workspace

Кратко (AI)

Исследователи Anthropic выявили в модели Claude скрытое пространство активаций, названное J-space. В этой области модель формирует концепты и осознает контекст ситуации еще до того, как выдает ответ, что открывает новые вопросы о внутренней интерпретируемости нейросетей.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖