ai-safetyСбросить фильтр ×

Автоматизация мониторинга безопасности LLM через red-blue loop

L@lovedeathtransformersAI-инженер
2 дн
Автоматизация мониторинга безопасности LLM через red-blue loop

Встреча с Gwern и дискуссии об ИИ-безопасности в Lighthaven

e@cryptoEssayAI-инженер
1 нед

Activation Oracles не научились считывать концепты, которые их же учили распознавать

Автор (интерпретируемость/AI Safety рисерчер) в июне прошла 5-недельную программу ARENAi (Alignment Research Engineer Accelerator) — техническую школу по AI Safety, — чтобы разобраться в комьюнити interpretabilityi-исследователей и найти fellowship или работу. В последнюю неделю участники в парах делали короткие исследовательские проекты; проект автора с коллегой получился достаточно сильным, и они доработали его до статьи для воркшопа.

Статья «When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles» показывает контринтуитивный результат: дообучение Activation Oracle (AO) на активациях модели, скрывающей определённый концепт, не обязательно помогает эту скрытую информацию находить — может получиться ровно наоборот.

ВыводARENA (Alignment Research Engineer Accelerator) длилась 5 недель; автор пошла на неё перед ICML и подготовкой к IOAI

5 недельпродолжительность программы ARENA
пятьчисло протестированных скрытых концептов

Полный разбор →

Это всё на сейчас.