← к умной ленте

Activation Oracles не научились считывать концепты, которые их же учили распознавать

Автор (интерпретируемость/AI Safety рисерчер) в июне прошла 5-недельную программу ARENAi (Alignment Research Engineer Accelerator) — техническую школу по AI Safety, — чтобы разобраться в комьюнити interpretabilityi-исследователей и найти fellowship или работу. В последнюю неделю участники в парах делали короткие исследовательские проекты; проект автора с коллегой получился достаточно сильным, и они доработали его до статьи для воркшопа.

Статья «When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles» показывает контринтуитивный результат: дообучение Activation Oracle (AO) на активациях модели, скрывающей определённый концепт, не обязательно помогает эту скрытую информацию находить — может получиться ровно наоборот.

5 недельпродолжительность программы ARENA
пятьчисло протестированных скрытых концептов
  • ARENA (Alignment Research Engineer Accelerator) длилась 5 недель; автор пошла на неё перед ICML и подготовкой к IOAI
  • Activation Oracles (AO)i — языковые модели, обученные отвечать на естественном языке на вопросы о внутренних активациях другой модели («о чём это скрытое состояние?»)
  • Гипотеза, которую тестировали авторы: если обучить AO на активациях модели со скрытой информацией (backdoor, скрытая цель, знание), AO должен легко находить эту информацию
  • Авторы взяли пять разных концептов и дообучили LLM скрывать каждый из них, затем обучили AO на активациях этих моделей
  • По словам автора, результат оказался противоположным ожиданиям — у AO возникают «слепые пятна» именно на тех концептах, которые модель обучена скрывать (детали механизма в источниках обрываются)
  • Статья опубликована автором на HF daily papers (Hugging Face)
  • Автор отмечает, что после ARENA у неё сложилось «довольно неоднозначное впечатление» о комьюнити AI Safety, но подробности обещает раскрыть позже

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖