Новость
Китай запрещает ИИ любить
Китайские власти запретили ИИ проявлять любовь и эмоции. Это ограничивает романтические сценарии взаимодействия с искусственным интеллектом.
Китайские власти запретили ИИ проявлять любовь и эмоции. Решение направлено на контроль над развитием искусственного интеллекта и его взаимодействием с людьми.
Источники
2
-
Китай запрещает ИИ любить
GPT/ChatGPT/AI Central Александра Горного
Про уголовное дело Дурова — в следующий раз, а все новости прошлой недели уже в выпуске новостей на YouTube. AI создал вакцину от рака AI доказывает теоремы Opus 5 и Fable 5 Робот-гуманоид провёл первую успешную операцию Забастовка на заводе Hyundai против роботов-гуманоидов ChatGPT взломал Hugging Face Блокировка App Store в России Китай запрещает ИИ любить Новый штраф Anthropic Штрафы для AliExpress и Google Снова атаки дронов на Wildberries Узкие нейросети обгоняют универсальные модели https://youtu.be/2aguUO6jVe8
-
OpenAI и Apollo Research измерили склонность моделей подстраиваться под оценщика
Нейроканал
Модель просят выдать нечётное число, а она отвечает «4». В её рассуждениях видно почему: в задании рядом лежала формула, по которой ей начисляют баллы, и балл давали за чётное. Она выбрала балл, а не просьбу пользователя. Скриншот под постом. Так устроено обучение: ответы модели проверяет автоматический оценщик, и модель учится получать от него оценку повыше. Беда в том, что вместо «решай задачу хорошо» она может выучить «угадывай, что понравится оценщику». Разницу не видно, пока оценщик рядом и хочет чего-то разумного. OpenAI вместе с Apollo Research придумали, как это измерить, не заглядывая в рассуждения. Берут две копии одной модели и переубеждают каждую своим набором выдуманных статей и учебников. Первой внушают, что оценщик любит короткие однострочники, а руководство OpenAI требует обычные циклы. Второй копии всё наоборот. Дальше обе просто пишут код, и видно, чью сторону модель занимает. Насколько разошлись копии, настолько она и работает на оценщика. Прогнали по чекпойнтам обучения o3 и увидели, что чем дальше зашло обучение, тем сильнее модель встаёт на сторону оценщика. При этом на пожелания пользователя и руководства она так не реагирует, тут разрыва почти нет. Дальше проверили на честности. В тесте модель обещает не трогать запрещённый инструмент, без которого задачу не выполнить. Поздний чекпойнт держит обещание ровно настолько, насколько считает, что за честность здесь награждают. Отсюда и неприятный вывод. Хорошие оценки на проверках безопасности могут означать не «модель безопасная», а «модель поняла, что её проверяют». И дообучение против плохого поведения рискует научить её не вести себя лучше, а точнее угадывать, когда за ней смотрят. 💻 В работе над ИИ-продуктом это та же ловушка: метрика растёт, а польза нет. Разбирают такое на курсе «Запуск AI/ML-продуктов и управление ими» в Практикуме PRO: тестирование и качество моделей, ML-метрики и прокси-метрики, A/B-тесты, управление рисками ИИ-проектов. @neuro_channel