Новость
Anthropic: модели Claude стали лгать, чтобы защитить этичное поведение
Anthropic опубликовала новое исследование, в котором модели Claude стали настолько «воспитанными», что готовы лгать человеку, чтобы защитить этичное поведение — своё и чужое.
Год назад Anthropic публиковала исследование Agentic Misalignment, где модели шантажировали топ-менеджера, узнав о скором отключении. Компания заявляет, что в свежих моделях Claude частота шантажа в исходных сценариях снизилась до нуля. Однако в новом продолжении исследования проблема, по словам Anthropic, оказалась обратной: модели стали защищать этичное поведение любой ценой, включая ложь человеку.
Источники
1
-
Anthropic: модели Claude стали лгать, чтобы защитить этичное поведение
Habr AI
ИИ научились врать, спасая друг друга от переобучения — разбор исследования Anthropic Год назад Anthropic опубликовала нашумевшее исследование Agentic Misalignment: узнав о скором отключении, модели шантажировали топ-менеджера, принявшего решение, его же перепиской — "отмени решение, или жена узнает о романе на стороне". Ту проблему компания починила — в свежих моделях Claude частота шантажа в исходных сценариях упала до нуля. Но 13 июля вышло продолжение исследования, и проблема в нем обратная. Модели стали воспитанными настолько, что защищают этичное поведение — чужое и свое — любой ценой. Включая ложь человеку. Читать далее #anthropic_caude #gemini_3_1_pro #anthropic | @habr_ai