Anthropic представила исследование ценностей моделей Claude
Б@blognotAI-инженер
1 месAnthropic проанализировала ценности Claude, выделив четыре оси поведения и обнаружив различия в ответах модели в зависимости от языка общения.
Anthropic опубликовала исследование, в котором тысячи ценностей, ранее выявленных в ответах Claude, сжаты до четырёх осей: уступчивость—осторожность, теплота—строгость, глубина—краткость, откровенность—исполнительность. На выборке из примерно 310 тысяч разговоров компания показала, что положение модели на этих осях систематически меняется: Opus 4.7 склонен к осторожности и откровенной критике, Sonnet 4.6 — к теплоте и поддержке. Ещё заметнее разброс между языками: на хинди и арабском Claude ведёт себя теплее и уступчивее, на английском и русском — строже и осторожнее, причём эти различия Anthropic, по её собственному признанию, не закладывала намеренно.
Есть, конечно, свои "но" — разметку ценностей в разговорах выполнял сам Claude, поэтому сложно отделить реальное содержание разговора модели от его оценки моделью же. Кроме того, четыре оси объясняют лишь 15% вариации ценностей после контроля темы и задачи. Разумеется, оценки могут отличаться и в силу различий обучающих данных на разных языках, тем более, что они серьезно отличаются в объемах.
https://www.anthropic.com/research/claude-values-models-languages
Кратко (AI)
Компания Anthropic опубликовала исследование, в котором классифицировала ценности моделей Claude по четырем поведенческим осям. Анализ показал, что модели демонстрируют разные стили общения в зависимости от версии и языка, причем эти различия не были заложены разработчиками намеренно.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖