Разработчик (канал Love. Death. Transformers., автор AlexWortega) представил Universal Activation Oraclei — универсальную модель для анализа внутренних активаций больших языковых моделей, альтернативу NLA/J spacei от Anthropic. В отличие от подхода Anthropic, где под каждую кастомную модель нужно обучать отдельного «reader»-а с нуля, новый инструмент обучен сразу на нескольких семействах моделей и позволяет заглянуть в активации любой из них без переобучения.
Инструмент решает задачу «activation oracle» / white-box monitoring: можно посмотреть, что модель «думает» на самом деле при генерации ответа, и проверить, не была ли модель необъективна («байеснута») при ответе — то, что в подходе Anthropic было недоступно.
20sвремя обучения адаптера на CPU
- NLA/J space от Anthropic работает так: обучается дополнительная модель-«reader», которая читает активации целевой модели и отвечает на основе них (по данным AbstractDL)
- Автору не понравились два ограничения NLA/J space: кастомные модели надо обучать с нуля, и нельзя проверить, была ли модель «байеснута» при формировании ответа
- Universal activation oracle обучена одновременно на разных семействах моделей, а не на одной
- Для новой модели используется динамический тонкий слой-адаптер, который обучается за 20 секунд на CPU и подгоняет размерности активаций под универсальный «оракул»
- Иногда требуется вручную подбирать («покрутить») слой, активации которого читаются, но по умолчанию инструмент работает «почти всегда» на средних слоях
- В качестве демонстрации показано, что модель Kimi3 «думает» о Путине — по словам автора, «ничего хорошего»
- Код и демо опубликованы как HuggingFace Space: huggingface.co/spaces/AlexWortega/activation-oracle
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖