Anthropic проанализировала 309 815 анонимизированных диалогов Claude.ai на 20 языках и обнаружила, что модель систематически ведёт себя по-разному в зависимости от языка общения и версии. Исследователи свели найденные ранее «ценности» модели к четырём осям поведения: уступчивость против осторожности, теплота против строгости, глубина против краткости, откровенность против ориентации на выполнение задачи.
Выяснилось, что на русском Claude становится самым строгим и прагматичным: чаще оспаривает предположения пользователя, требует доказательств и придирается к деталям. На английском модель осторожнее и подробнее, на хинди и арабском — теплее и мягче, на голландском чаще признаёт свои ошибки и неуверенность, а на индонезийском меньше рефлексирует и просто выполняет задачу. Для мультиязычных продуктов на базе Claude это означает, что один и тот же запрос может получить принципиально разный по тону ответ просто из-за языка, на котором его задали.
ВыводДля анализа исследователи сжали 3307 найденных «ценностей» модели до 339 более общих категорий, из которых затем вывели четыре поведенческие оси.
309 815проанализированных диалогов Claude.ai
3 307 → 339ценностей сжато до категорий
15%доля вариации ценностей, объяснённая осями
Полный разбор →