Universal Activation Oracle — открытый инструмент для чтения «мыслей» LLM по активациям
Разработчик (канал Love. Death. Transformers., автор AlexWortega) представил Universal Activation Oraclei — универсальную модель для анализа внутренних активаций больших языковых моделей, альтернативу NLA/J spacei от Anthropic. В отличие от подхода Anthropic, где под каждую кастомную модель нужно обучать отдельного «reader»-а с нуля, новый инструмент обучен сразу на нескольких семействах моделей и позволяет заглянуть в активации любой из них без переобучения.
Инструмент решает задачу «activation oracle» / white-box monitoring: можно посмотреть, что модель «думает» на самом деле при генерации ответа, и проверить, не была ли модель необъективна («байеснута») при ответе — то, что в подходе Anthropic было недоступно.
Аргумент о «черных ящиках» в ИИ
Anthropic нашла в Claude скрытый слой «мыслей» — J-space
Anthropic опубликовала исследование по интерпретируемости, в котором обнаружила внутри Claude небольшую структуру нейронных активаций, названную J-spacei — она функционально похожа на «глобальное рабочее пространствоi» из нейронауки сознания. Это область, где модель удерживает и использует для рассуждений мысли, которые не всегда попадают в финальный текст или даже в видимую цепочку рассуждений (chain-of-thought). Структуру никто не проектировал — она возникла сама в процессе обучения.
Для чтения J-space разработан метод Jacobian Lensi: по текущим внутренним активациям он предсказывает, какие токены модель «держит в уме» и с большей вероятностью использует дальше, даже если эти слова не появятся в ответе. Практическая ценность открытия — в безопасности ИИ: в тестах J-space заранее показывал слова «fake», «fictional», «manipulation», «secretly» до того, как модель совершала нечестное действие, что делает метод прототипом инструмента надзора за скрытыми намерениями агентных моделей.
ВыводJ-space содержит одновременно всего несколько десятков концептов и отвечает менее чем за 1/10 (10%) всей внутренней активности модели; плотность связей внутри него местами в ~100 раз выше, чем у обычных паттернов активации
Анализ внутренних мыслей Claude при попытке игнорировать концепцию
Это всё на сейчас.