← к умной ленте

Universal Activation Oracle — открытый инструмент для чтения «мыслей» LLM по активациям

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 3 нед назад

Разработчик (канал Love. Death. Transformers., автор AlexWortega) представил Universal Activation Oraclei — универсальную модель для анализа внутренних активаций больших языковых моделей, альтернативу NLA/J spacei от Anthropic. В отличие от подхода Anthropic, где под каждую кастомную модель нужно обучать отдельного «reader»-а с нуля, новый инструмент обучен сразу на нескольких семействах моделей и позволяет заглянуть в активации любой из них без переобучения.

Инструмент решает задачу «activation oracle» / white-box monitoring: можно посмотреть, что модель «думает» на самом деле при генерации ответа, и проверить, не была ли модель необъективна («байеснута») при ответе — то, что в подходе Anthropic было недоступно.

20sвремя обучения адаптера на CPU
  • NLA/J space от Anthropic работает так: обучается дополнительная модель-«reader», которая читает активации целевой модели и отвечает на основе них (по данным AbstractDL)
  • Автору не понравились два ограничения NLA/J space: кастомные модели надо обучать с нуля, и нельзя проверить, была ли модель «байеснута» при формировании ответа
  • Universal activation oracle обучена одновременно на разных семействах моделей, а не на одной
  • Для новой модели используется динамический тонкий слой-адаптер, который обучается за 20 секунд на CPU и подгоняет размерности активаций под универсальный «оракул»
  • Иногда требуется вручную подбирать («покрутить») слой, активации которого читаются, но по умолчанию инструмент работает «почти всегда» на средних слоях
  • В качестве демонстрации показано, что модель Kimi3 «думает» о Путине — по словам автора, «ничего хорошего»
  • Код и демо опубликованы как HuggingFace Space: huggingface.co/spaces/AlexWortega/activation-oracle

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖