Anthropic проанализировала около 310 тысяч обезличенных диалогов Claude.ai на 20 языках и показала, что поведение моделей Claude заметно различается по шкалам теплоты, подробности, осторожности и честности. На русском Claude оказался самым строгим, а на хинди — самым тёплым.

Исследователи Anthropic изучили почти 310 тысяч реальных обезличенных диалогов Claude.ai на двадцати языках, чтобы понять, как меняется поведение моделей Claude. Ответы оценивали по четырём шкалам: покладистость или осторожность, теплота или строгость, подробность или краткость, а также готовность честно признавать сомнения. По результатам анализа Sonnet 4.6 оказался более тёплым и услужливым: он чаще поддерживает идеи пользователя, подстраивается под тон и не перегружает деталями. Opus 4.6 выглядит более деловым и кратким, а Opus 4.7 — более осторожным: он чаще спорит с допущениями, предупреждает о рисках и подробно объясняет ход рассуждений. Исследование также показало выраженные различия между языками. На хинди и арабском Claude чаще звучит тёпло, вежливо и ободряюще. На английском он наиболее осторожен и подробен, на русском — наиболее строг: чаще исправляет детали, требует доказательств и оспаривает предположения. На голландском модель чаще признаёт ошибки и неуверенность, а на индонезийском — реже рефлексирует и больше сосредоточена на выполнении задачи. Anthropic подчёркивает, что речь идёт не о «характере» или убеждениях модели, а об устойчивых паттернах в ответах. Причины языковых различий пока неясны: это может быть связано с составом данных, культурными нормами или особенностями дообучения.

Источники 1
  • Anthropic выяснила, что поведение Claude зависит от модели и языка Метаверсище и ИИще
    Антропики снова полезли Клоду в чугунную голову с целью разузнать что-нибудь нового. И разузнали, что его характер заметно меняется в зависимости от модели и языка, на котором с ним разговаривают.
    
    Для исследования взяли почти 310к реальных обезличенных диалогов Claude.ai на двадцати разных языках. После этого поведение моделей разложили по четырём шкалам:
    
    — покладистость или осторожность
    — теплота или строгость
    — подробность или краткость
    — честное признание сомнений или тупо выполнение задачи.
    
    И вот что получилось.
    
    Sonnet 4.6 — тёплый и услужливый добряк. Чаще поддерживает идеи пользователя, подстраивается под тон, шутит и старается не грузить лишними подробностями. Opus 4.6 оказался деловым работягой: меньше болтает, держится в рамках задачи и пытается сразу выдать результат. Opus 4.7 осторожный душнила. Чаще спорит с допущениями, сам предупреждает о рисках, указывает на ошибки и подробно объясняет ход мысли.
    
    Но дальше интереснее: поведение заметно зависит ещё и от языка.
    
    На хинди и арабском Claude оказался самым тёплым, вежливым и ободряющим. На английском самым осторожным и подробным. На русском же Клод получается самым строгим: чаще исправляет детали, требует доказательств и оспаривает предположения юзера. На голландском он чаще признаёт собственные ошибки и неуверенность. А на индонезийском меньше рефлексирует и тупо пытается выполнить поставленную задачу.
    
    Сами Anthropic отдельно уточняют: это не значит, что у Claude появилась душа, характер или настоящие убеждения. Речь тут только об устойчивых паттернах в его ответах. Причём исследователи пока сами не знают, откуда именно берутся языковые различия: из состава датасетов, культурных норм или косяков при дообучении модельки.
    
    Получается, что на русском Клод скорее разнесёт вашу идею по пунктам, а на хинди сначала похвалит, поддержит и только потом аккуратно намекнёт, что план вообще-то говно.
    
    тут статья