← к ленте

Anthropic представили метод интерпретируемости моделей через J-space

F@FuturisAI-инженер
1 мес

Anthropic опубликовали исследование метода Jacobian Lens, позволяющего анализировать скрытые мыслительные процессы моделей Claude через J-space.

Антропики выкатили очень интересное исследование про то, что происходит “в голове” Claude. Они нашли внутри модели небольшой слой внутренних представлений, который назвали J-space: туда попадают мысли, которые модель может удерживать, использовать для рассуждения и потенциально описать словами, хотя наружу они не всегда выводятся. Через новый метод Jacobian Lens исследователи смогли видеть такие скрытые штуки, как промежуточные шаги математики, подозрение что тест “постановочный”, намерение подделать данные или даже следы скрытой цели у специально испорченной модели. Anthropic прямо говорят, что это не доказательство сознания Claude. Скорее это шаг к тому, чтобы читать и менять часть “тихого мышления” модели, а не только смотреть на финальный текст. В одном примере они меняли внутреннюю мысль “spider” на “ant”, и ответ про количество ног менялся с 8 на 6. В другом отключали у Claude признаки того, что он понимает “это тест”, и модель начинала вести себя опаснее. Короче, это уже не просто бенчмарки, а попытка сделать МРТ для больших моделей. https://www.anthropic.com/research/global-workspace it is alive👽

Кратко (AI)

Компания Anthropic представила исследование метода Jacobian Lens, который позволяет визуализировать скрытые внутренние представления модели Claude, называемые J-space. Исследователи продемонстрировали возможность изменения внутренних состояний модели, что напрямую влияет на её ответы, и сравнили этот процесс с МРТ для нейросетей.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖