Новость
Anthropic выяснила, что поведение Claude зависит от модели и языка
Anthropic проанализировала около 310 тысяч обезличенных диалогов Claude.ai на 20 языках и показала, что поведение моделей Claude заметно различается по шкалам теплоты, подробности, осторожности и честности. На русском Claude оказался самым строгим, а на хинди — самым тёплым.
Исследователи Anthropic изучили почти 310 тысяч реальных обезличенных диалогов Claude.ai на двадцати языках, чтобы понять, как меняется поведение моделей Claude. Ответы оценивали по четырём шкалам: покладистость или осторожность, теплота или строгость, подробность или краткость, а также готовность честно признавать сомнения. По результатам анализа Sonnet 4.6 оказался более тёплым и услужливым: он чаще поддерживает идеи пользователя, подстраивается под тон и не перегружает деталями. Opus 4.6 выглядит более деловым и кратким, а Opus 4.7 — более осторожным: он чаще спорит с допущениями, предупреждает о рисках и подробно объясняет ход рассуждений. Исследование также показало выраженные различия между языками. На хинди и арабском Claude чаще звучит тёпло, вежливо и ободряюще. На английском он наиболее осторожен и подробен, на русском — наиболее строг: чаще исправляет детали, требует доказательств и оспаривает предположения. На голландском модель чаще признаёт ошибки и неуверенность, а на индонезийском — реже рефлексирует и больше сосредоточена на выполнении задачи. Anthropic подчёркивает, что речь идёт не о «характере» или убеждениях модели, а об устойчивых паттернах в ответах. Причины языковых различий пока неясны: это может быть связано с составом данных, культурными нормами или особенностями дообучения.
-
Anthropic выяснила, что поведение Claude зависит от модели и языка
Метаверсище и ИИще
Антропики снова полезли Клоду в чугунную голову с целью разузнать что-нибудь нового. И разузнали, что его характер заметно меняется в зависимости от модели и языка, на котором с ним разговаривают. Для исследования взяли почти 310к реальных обезличенных диалогов Claude.ai на двадцати разных языках. После этого поведение моделей разложили по четырём шкалам: — покладистость или осторожность — теплота или строгость — подробность или краткость — честное признание сомнений или тупо выполнение задачи. И вот что получилось. Sonnet 4.6 — тёплый и услужливый добряк. Чаще поддерживает идеи пользователя, подстраивается под тон, шутит и старается не грузить лишними подробностями. Opus 4.6 оказался деловым работягой: меньше болтает, держится в рамках задачи и пытается сразу выдать результат. Opus 4.7 осторожный душнила. Чаще спорит с допущениями, сам предупреждает о рисках, указывает на ошибки и подробно объясняет ход мысли. Но дальше интереснее: поведение заметно зависит ещё и от языка. На хинди и арабском Claude оказался самым тёплым, вежливым и ободряющим. На английском самым осторожным и подробным. На русском же Клод получается самым строгим: чаще исправляет детали, требует доказательств и оспаривает предположения юзера. На голландском он чаще признаёт собственные ошибки и неуверенность. А на индонезийском меньше рефлексирует и тупо пытается выполнить поставленную задачу. Сами Anthropic отдельно уточняют: это не значит, что у Claude появилась душа, характер или настоящие убеждения. Речь тут только об устойчивых паттернах в его ответах. Причём исследователи пока сами не знают, откуда именно берутся языковые различия: из состава датасетов, культурных норм или косяков при дообучении модельки. Получается, что на русском Клод скорее разнесёт вашу идею по пунктам, а на хинди сначала похвалит, поддержит и только потом аккуратно намекнёт, что план вообще-то говно. тут статья