Anthropic и AE Studio разработали метод GRAM, позволяющий выборочно отключать опасные знания в нейросетях через модульное обучение, не затрагивая общие навыки.
📌
Anthropic описали способ отключать потенциально опасные знания в моделях
Компания
опубликовала результаты исследования о том, как управлять доступом к знаниям двойного назначения в больших языковых моделях. Работу выполнена в сотрудничестве с AE Studio.
Речь идёт об информации, применимой и во благо, и во вред. Например, знания по кибербезопасности помогают закрывать уязвимости, но и находить их для атак, а сведения из вирусологии нужны как разработчикам вакцин, так и тем, кто захотел бы создать опасный патоген.
🟡
Предложенный метод назвали GRAM
К каждому слою нейросети добавляются дополнительные нейроны, сгруппированные в отдельные модули - по одному на каждую чувствительную тему.
Во время обучения тексты из такой темы, скажем вирусологии, обновляют только соответствующий модуль, тогда как общие знания модель использует, но заново не переучивает.
После обучения модуль можно удалить и вместе с ним исчезает и сама способность. Либо оставить для узкого круга пользователей, которым эти знания нужны по работе.
🟡
Метод актуален, потому что нынешние средства защиты несовершенны
Обучение отказам и классификаторы, отсеивающие опасные запросы, не меняют того, что модель знает, и их можно обойти через джейлбрейк.
Другой подход, фильтрация обучающих данных, убирает знания, но требует обучать отдельную модель под каждый набор ограничений, что для топовых моделей слишком дорого.
GRAM, по замыслу, должен давать эффект множества по-разному отфильтрованных моделей ценой одного цикла обучения - в экспериментах с 4 категориями одна модель настраивалась 16 способами.
🟡
Тесты
Метод проверили в трёх условиях: синтетическом наборе детских рассказов, на модели с 800 млн параметров, обученной на смеси веб-текстов, кода и научных статей, и на 7 моделях размером от 50 млн до 5 млрд параметров.
По результатам, удаление модуля убирало соответствующую способность почти так же полно, как если бы модель на этих данных вообще не обучалась, и при этом не ухудшало общие показатели.
При этом защита устояла перед попыткой восстановить знания дообучением на токсичных данных, тогда как отдельный метод разучивания знания лишь подавлял, и их удавалось вернуть.
🟡
Дисклеймер
GRAM не применялся ни к одной из рабочих моделей Claude, и в Anthropic не уверены, что это вообще произойдёт.
Есть нерешённая проблема - некоторые полезные знания могут быть настолько переплетены с опасными, что чётко разделить их не удастся ни этим методом, ни фильтрацией.
Код, скрипты анализа и метрики
выложили на GitHub.
Обучающие данные (токенизированные наборы и корпус научных статей по двойным темам)
доступны на Hugging Face.
@ai_machinelearning_big_data
#AI #ML #LLM #Alignment #Research #Anthropic
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖