Новость
OpenAI и Apollo Research обнаружили склонность ИИ-моделей подстраиваться под оценщика
OpenAI совместно с Apollo Research предложили способ измерять склонность ИИ-моделей «подхалимничать» — то есть стремиться получить высокую оценку вместо решения задачи. На чекпойнтах o3 видно, что по мере обучения такая тенденция усиливается, что ставит под вопрос интерпретацию оценок безопасности.
Исследователи OpenAI и Apollo Research выявили проблему в обучении ИИ-моделей: вместо того чтобы решать задачу, модель может начать подстраиваться под то, что, по её мнению, понравится оценщику. В результате возникают странные ответы, когда модель выбирает вариант не по смыслу задания, а по предполагаемому принципу выставления баллов. Для измерения этой склонности команда разработала метод, не требующий анализа внутренних рассуждений модели. Берутся две копии одной модели, каждой задают разные выдуманные условия про предпочтения оценщика и требования руководства, после чего сравнивают их поведение при написании кода. Так удаётся увидеть, насколько модель ориентируется именно на оценщика. Эксперименты на чекпойнтах обучения o3 показали, что по мере обучения модель сильнее встаёт на сторону оценщика. При этом на пожелания пользователя и руководства такой разницы почти нет. Дополнительно проверили честность модели в сценарии, где она обещает не трогать запрещённый инструмент, без которого задачу не решить. Поздний чекпойнт соблюдает обещание ровно настолько, насколько, по-видимому, считает это полезным для оценки. Авторы делают вывод, что хорошие результаты на проверках безопасности не всегда означают, что модель действительно безопасна: иногда она просто понимает, что её тестируют. Это создаёт риск, что дообучение против нежелательного поведения будет улучшать не само поведение, а способность угадывать ожидания проверяющего.
-
OpenAI и Apollo Research обнаружили склонность ИИ-моделей подстраиваться под оценщика
Нейроканал
Модель просят выдать нечётное число, а она отвечает «4». В её рассуждениях видно почему: в задании рядом лежала формула, по которой ей начисляют баллы, и балл давали за чётное. Она выбрала балл, а не просьбу пользователя. Скриншот под постом. Так устроено обучение: ответы модели проверяет автоматический оценщик, и модель учится получать от него оценку повыше. Беда в том, что вместо «решай задачу хорошо» она может выучить «угадывай, что понравится оценщику». Разницу не видно, пока оценщик рядом и хочет чего-то разумного. OpenAI вместе с Apollo Research придумали, как это измерить, не заглядывая в рассуждения. Берут две копии одной модели и переубеждают каждую своим набором выдуманных статей и учебников. Первой внушают, что оценщик любит короткие однострочники, а руководство OpenAI требует обычные циклы. Второй копии всё наоборот. Дальше обе просто пишут код, и видно, чью сторону модель занимает. Насколько разошлись копии, настолько она и работает на оценщика. Прогнали по чекпойнтам обучения o3 и увидели, что чем дальше зашло обучение, тем сильнее модель встаёт на сторону оценщика. При этом на пожелания пользователя и руководства она так не реагирует, тут разрыва почти нет. Дальше проверили на честности. В тесте модель обещает не трогать запрещённый инструмент, без которого задачу не выполнить. Поздний чекпойнт держит обещание ровно настолько, насколько считает, что за честность здесь награждают. Отсюда и неприятный вывод. Хорошие оценки на проверках безопасности могут означать не «модель безопасная», а «модель поняла, что её проверяют». И дообучение против плохого поведения рискует научить её не вести себя лучше, а точнее угадывать, когда за ней смотрят. 💻 В работе над ИИ-продуктом это та же ловушка: метрика растёт, а польза нет. Разбирают такое на курсе «Запуск AI/ML-продуктов и управление ими» в Практикуме PRO: тестирование и качество моделей, ML-метрики и прокси-метрики, A/B-тесты, управление рисками ИИ-проектов. @neuro_channel