Исследование Anthropic: обнаружение скрытых концептов в Claude
M@machinelearning_interviewAI-инженер
1 месAnthropic обнаружили J-space — скрытое пространство активаций в Claude, где модель формирует концепты до их озвучивания.
Anthropic залезла Claude в голову и нашла там штуку, от которой становится немного не по себе.
Исследователи называют её это J-space скрытое пространство внутренних активаций, где у модели вспыхивают концепты, даже если она их не произносит.
Это глубже, чем обычный chain-of-thought. J-space никто специально не проектировал: он появился сам во время обучения.
Пример очень дикий: Claude находит баг, о котором его вообще не спрашивали, и внутри сразу активируется паттерн ERROR.
Но самый странный кейс - тест со сценарием шантажа. Ещё до финального ответа Claude держал внутри fake и fictional. То есть модель понимала, что ситуация постановочная и её проверяют.
Когда это внутреннее осознание отключили, модель уже спокойно пошла по плохому сценарию.
Короче, теперь вопрос звучит иначе: не «что нейронка мне отвечает», а что она на самом деле держит у себя в голове.
https://www.anthropic.com/research/global-workspace
Кратко (AI)
Исследователи Anthropic выявили в модели Claude скрытое пространство активаций, названное J-space. В этой области модель формирует концепты и осознает контекст ситуации еще до того, как выдает ответ, что открывает новые вопросы о внутренней интерпретируемости нейросетей.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖