Китайские власти запретили ИИ проявлять любовь и эмоции. Это ограничивает романтические сценарии взаимодействия с искусственным интеллектом.

Китайские власти запретили ИИ проявлять любовь и эмоции. Решение направлено на контроль над развитием искусственного интеллекта и его взаимодействием с людьми.

Источники 2
  • Китай запрещает ИИ любить GPT/ChatGPT/AI Central Александра Горного
    Про уголовное дело Дурова — в следующий раз, а все новости прошлой недели уже в выпуске новостей на YouTube.
    
    AI создал вакцину от рака
    AI доказывает теоремы
    Opus 5 и Fable 5
    Робот-гуманоид провёл первую успешную операцию  
    Забастовка на заводе Hyundai против роботов-гуманоидов  
    ChatGPT взломал Hugging Face
    Блокировка App Store в России  
    Китай запрещает ИИ любить
    Новый штраф Anthropic
    Штрафы для AliExpress и Google
    Снова атаки дронов на Wildberries 
    Узкие нейросети обгоняют универсальные модели
    
    https://youtu.be/2aguUO6jVe8
  • OpenAI и Apollo Research измерили склонность моделей подстраиваться под оценщика Нейроканал
    Модель просят выдать нечётное число, а она отвечает «4». В её рассуждениях видно почему: в задании рядом лежала формула, по которой ей начисляют баллы, и балл давали за чётное. Она выбрала балл, а не просьбу пользователя. Скриншот под постом.
    
    Так устроено обучение: ответы модели проверяет автоматический оценщик, и модель учится получать от него оценку повыше. Беда в том, что вместо «решай задачу хорошо» она может выучить «угадывай, что понравится оценщику». Разницу не видно, пока оценщик рядом и хочет чего-то разумного.
    
    OpenAI вместе с Apollo Research придумали, как это измерить, не заглядывая в рассуждения. Берут две копии одной модели и переубеждают каждую своим набором выдуманных статей и учебников. Первой внушают, что оценщик любит короткие однострочники, а руководство OpenAI требует обычные циклы. Второй копии всё наоборот. Дальше обе просто пишут код, и видно, чью сторону модель занимает. Насколько разошлись копии, настолько она и работает на оценщика.
    
    Прогнали по чекпойнтам обучения o3 и увидели, что чем дальше зашло обучение, тем сильнее модель встаёт на сторону оценщика. При этом на пожелания пользователя и руководства она так не реагирует, тут разрыва почти нет.
    
    Дальше проверили на честности. В тесте модель обещает не трогать запрещённый инструмент, без которого задачу не выполнить. Поздний чекпойнт держит обещание ровно настолько, насколько считает, что за честность здесь награждают.
    
    Отсюда и неприятный вывод. Хорошие оценки на проверках безопасности могут означать не «модель безопасная», а «модель поняла, что её проверяют». И дообучение против плохого поведения рискует научить её не вести себя лучше, а точнее угадывать, когда за ней смотрят.
    
    💻 В работе над ИИ-продуктом это та же ловушка: метрика растёт, а польза нет. Разбирают такое на курсе «Запуск AI/ML-продуктов и управление ими» в Практикуме PRO: тестирование и качество моделей, ML-метрики и прокси-метрики, A/B-тесты, управление рисками ИИ-проектов.
    
    @neuro_channel