Новость
Anthropic представила метод GRAM для избирательного отключения опасных знаний в языковых моделях
Anthropic вместе с AE Studio разработала метод GRAM (Gated Representation Adapter Modules), который позволяет отключать знания по чувствительным темам, не затрагивая общие способности модели. Авторы считают, что это может стать более гибкой альтернативой обучению отказам и фильтрации данных.
Anthropic опубликовала исследование о том, как управлять доступом к знаниям двойного назначения в больших языковых моделях. Работа выполнена в сотрудничестве с AE Studio. Речь идёт о знаниях, которые могут использоваться и во благо, и во вред. В качестве примеров авторы приводят кибербезопасность и вирусологию: такие области полезны для защиты и науки, но могут быть применимы и в опасных сценариях. Предложенный метод получил название GRAM. В его основе — дополнительные нейроны, сгруппированные в отдельные модули по одной чувствительной теме и добавляемые к каждому слою нейросети. Во время обучения тексты по конкретной теме обновляют только соответствующий модуль, тогда как общие знания модели не переобучаются. После обучения модуль можно удалить, и вместе с ним исчезает и соответствующая способность. При необходимости модуль можно оставить для ограниченного круга пользователей, которым эти знания нужны по работе. Авторы отмечают, что существующие способы защиты несовершенны. Обучение отказам и классификаторы не меняют саму модель и могут обходиться через джейлбрейк. Фильтрация обучающих данных, в свою очередь, убирает знания, но требует обучать отдельную модель под каждый набор ограничений, что дорого для крупных систем. По замыслу GRAM должен давать эффект нескольких по-разному отфильтрованных моделей ценой одного цикла обучения. Метод проверили в трёх условиях: на синтетическом наборе детских рассказов, на модели с 800 млн параметров, обученной на смеси веб-текстов, кода и научных статей, а также на семи моделях размером от 50 млн до 5 млрд параметров. По результатам экспериментов удаление модуля почти так же полно убирало соответствующую способность, как если бы модель на этих данных вообще не обучалась, и не ухудшало общие показатели. При этом защита устояла перед попыткой восстановить знания дообучением на токсичных данных, тогда как отдельный метод разучивания знаний лишь подавлял их, и их удавалось вернуть. В Anthropic подчёркивают, что GRAM не применялся ни к одной из рабочих моделей Claude, и неясно, будет ли это сделано. Авторы также отмечают нерешённую проблему: некоторые полезные знания могут быть настолько переплетены с опасными, что чётко разделить их не удастся ни этим методом, ни фильтрацией. Код, скрипты анализа и метрики опубликованы на GitHub. Обучающие данные доступны на Hugging Face.
-
Anthropic представила метод GRAM для избирательного отключения опасных знаний в языковых моделях
Machinelearning
📌 Anthropic описали способ отключать потенциально опасные знания в моделях Компания опубликовала результаты исследования о том, как управлять доступом к знаниям двойного назначения в больших языковых моделях. Работу выполнена в сотрудничестве с AE Studio. Речь идёт об информации, применимой и во благо, и во вред. Например, знания по кибербезопасности помогают закрывать уязвимости, но и находить их для атак, а сведения из вирусологии нужны как разработчикам вакцин, так и тем, кто захотел бы создать опасный патоген. 🟡 Предложенный метод назвали GRAM К каждому слою нейросети добавляются дополнительные нейроны, сгруппированные в отдельные модули - по одному на каждую чувствительную тему. Во время обучения тексты из такой темы, скажем вирусологии, обновляют только соответствующий модуль, тогда как общие знания модель использует, но заново не переучивает. После обучения модуль можно удалить и вместе с ним исчезает и сама способность. Либо оставить для узкого круга пользователей, которым эти знания нужны по работе. 🟡 Метод актуален, потому что нынешние средства защиты несовершенны Обучение отказам и классификаторы, отсеивающие опасные запросы, не меняют того, что модель знает, и их можно обойти через джейлбрейк. Другой подход, фильтрация обучающих данных, убирает знания, но требует обучать отдельную модель под каждый набор ограничений, что для топовых моделей слишком дорого. GRAM, по замыслу, должен давать эффект множества по-разному отфильтрованных моделей ценой одного цикла обучения - в экспериментах с 4 категориями одна модель настраивалась 16 способами. 🟡Тесты Метод проверили в трёх условиях: синтетическом наборе детских рассказов, на модели с 800 млн параметров, обученной на смеси веб-текстов, кода и научных статей, и на 7 моделях размером от 50 млн до 5 млрд параметров. По результатам, удаление модуля убирало соответствующую способность почти так же полно, как если бы модель на этих данных вообще не обучалась, и при этом не ухудшало общие показатели. При этом защита устояла перед попыткой восстановить знания дообучением на токсичных данных, тогда как отдельный метод разучивания знания лишь подавлял, и их удавалось вернуть. 🟡Дисклеймер GRAM не применялся ни к одной из рабочих моделей Claude, и в Anthropic не уверены, что это вообще произойдёт. Есть нерешённая проблема - некоторые полезные знания могут быть настолько переплетены с опасными, что чётко разделить их не удастся ни этим методом, ни фильтрацией. Код, скрипты анализа и метрики выложили на GitHub. Обучающие данные (токенизированные наборы и корпус научных статей по двойным темам) доступны на Hugging Face. @ai_machinelearning_big_data #AI #ML #LLM #Alignment #Research #Anthropic