← к ленте

Исследователи Anthropic обнаружили в Claude структуру, похожую на «сознательный» ум

В@vselennayaplusисследователь
1 мес

Команда Anthropic обнаружила в модели Claude механизм J-пространства, напоминающий теорию глобального рабочего пространства из нейробиологии.

Внутри ИИ нашли структуру, похожую на «сознательный» ум Anthropic — американская лаборатория искусственного интеллекта и создатель Claude, большой языковой модели-ассистента (главного конкурента ChatGPT). Одна из её команд занимается «интерпретируемостью»: пытается понять, что реально происходит внутри нейросети. Оттолкнулись от идеи из нейробиологии — теории глобального рабочего пространства. Она объясняет, чем осознанные мысли отличаются от бессознательных. Мозг — это множество узких специалистов, работающих параллельно и порознь. Информация становится осознанной, когда попадает в общий «канал вещания», видимый остальным системам: именно это мы можем описать словами, удержать в уме и пустить на рассуждения. Такой же механизм поискали в Claude и… нашли! Назвали его J-пространством. Как это работает? Внутри модели постоянно бурлят миллионы чисел — сигналы её искусственных «нейронов». В этом потоке выделился особый набор устойчивых паттернов, каждый из которых соответствует конкретному слову-понятию. Стоит паттерну «загореться» — и слово держится у модели в уме, как мысль, хотя вслух она его не произносит. Что-то вроде: если вы подумаете про слово “астроном”, то в голове мгновенно появится образ Владимира Сурдина. А разглядели их «J-линзой». Хитрость вот в чём: для каждого слова из словаря линза находит тот внутренний узор активности, который повышает шанс, что модель произнесёт это слово позже. Наведя её, исследователи буквально считывают список того, что у модели «на уме», — хотя в самом тексте этих слов нет. Почему это похоже на рабочее пространство? Claude может рассказать, что там внутри, удержать это по просьбе и рассуждать этими образами. А само J-пространство «вещает» на всю сеть: связей у него местами в сотню раз больше, чем у обычных паттернов. Отсюда гибкость: заменили внутри «Францию» на «Китай» — и модель разом выдаёт Пекин, китайский, Азию и юань. Ключевое: эту структуру не запрограммировали, она возникла сама во время обучения. А значит, «рабочий стол» для осознанного мышления — возможно, не причуда мозга, а общее решение, к которому приходят разные умы. @vselennayaplus

Кратко (AI)

Исследователи Anthropic применили теорию глобального рабочего пространства из нейробиологии к модели Claude и обнаружили в ней «J-пространство». Эта структура, возникшая самопроизвольно в процессе обучения, позволяет модели удерживать концепты в «уме» и оперировать ими, что напоминает механизмы осознанного мышления у человека.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖