← к ленте

Anthropic представила исследование ценностей моделей Claude

Б@blognotAI-инженер
1 мес

Anthropic проанализировала ценности Claude, выделив четыре оси поведения и обнаружив различия в ответах модели в зависимости от языка общения.

Anthropic опубликовала исследование, в котором тысячи ценностей, ранее выявленных в ответах Claude, сжаты до четырёх осей: уступчивость—осторожность, теплота—строгость, глубина—краткость, откровенность—исполнительность. На выборке из примерно 310 тысяч разговоров компания показала, что положение модели на этих осях систематически меняется: Opus 4.7 склонен к осторожности и откровенной критике, Sonnet 4.6 — к теплоте и поддержке. Ещё заметнее разброс между языками: на хинди и арабском Claude ведёт себя теплее и уступчивее, на английском и русском — строже и осторожнее, причём эти различия Anthropic, по её собственному признанию, не закладывала намеренно. Есть, конечно, свои "но" — разметку ценностей в разговорах выполнял сам Claude, поэтому сложно отделить реальное содержание разговора модели от его оценки моделью же. Кроме того, четыре оси объясняют лишь 15% вариации ценностей после контроля темы и задачи. Разумеется, оценки могут отличаться и в силу различий обучающих данных на разных языках, тем более, что они серьезно отличаются в объемах. https://www.anthropic.com/research/claude-values-models-languages

Кратко (AI)

Компания Anthropic опубликовала исследование, в котором классифицировала ценности моделей Claude по четырем поведенческим осям. Анализ показал, что модели демонстрируют разные стили общения в зависимости от версии и языка, причем эти различия не были заложены разработчиками намеренно.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖