Автор (интерпретируемость/AI Safety рисерчер) в июне прошла 5-недельную программу ARENAi (Alignment Research Engineer Accelerator) — техническую школу по AI Safety, — чтобы разобраться в комьюнити interpretabilityi-исследователей и найти fellowship или работу. В последнюю неделю участники в парах делали короткие исследовательские проекты; проект автора с коллегой получился достаточно сильным, и они доработали его до статьи для воркшопа.
Статья «When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles» показывает контринтуитивный результат: дообучение Activation Oracle (AO) на активациях модели, скрывающей определённый концепт, не обязательно помогает эту скрытую информацию находить — может получиться ровно наоборот.
ВыводARENA (Alignment Research Engineer Accelerator) длилась 5 недель; автор пошла на неё перед ICML и подготовкой к IOAI