Автор (интерпретируемость/AI Safety рисерчер) в июне прошла 5-недельную программу ARENAi (Alignment Research Engineer Accelerator) — техническую школу по AI Safety, — чтобы разобраться в комьюнити interpretabilityi-исследователей и найти fellowship или работу. В последнюю неделю участники в парах делали короткие исследовательские проекты; проект автора с коллегой получился достаточно сильным, и они доработали его до статьи для воркшопа.
Статья «When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles» показывает контринтуитивный результат: дообучение Activation Oracle (AO) на активациях модели, скрывающей определённый концепт, не обязательно помогает эту скрытую информацию находить — может получиться ровно наоборот.
- ARENA (Alignment Research Engineer Accelerator) длилась 5 недель; автор пошла на неё перед ICML и подготовкой к IOAI
- Activation Oracles (AO)i — языковые модели, обученные отвечать на естественном языке на вопросы о внутренних активациях другой модели («о чём это скрытое состояние?»)
- Гипотеза, которую тестировали авторы: если обучить AO на активациях модели со скрытой информацией (backdoor, скрытая цель, знание), AO должен легко находить эту информацию
- Авторы взяли пять разных концептов и дообучили LLM скрывать каждый из них, затем обучили AO на активациях этих моделей
- По словам автора, результат оказался противоположным ожиданиям — у AO возникают «слепые пятна» именно на тех концептах, которые модель обучена скрывать (детали механизма в источниках обрываются)
- Статья опубликована автором на HF daily papers (Hugging Face)
- Автор отмечает, что после ARENA у неё сложилось «довольно неоднозначное впечатление» о комьюнити AI Safety, но подробности обещает раскрыть позже
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖