← к ленте

Почему ИИ-модели демонстрируют культурный перекос в сторону Японии

Д@disruptors_officialмедиа / агрегатор
4 нед

Анализ исследования, показывающего, почему современные ИИ-модели при ответе на культурные вопросы непропорционально часто выбирают Японию.

ИИ-модели не нейтральны и имеют встроенные культурные предпочтения, сформированные данными и процессом обучения.

  • Разработчики ИИ должны учитывать культурные искажения при создании обучающих датасетов.
  • Понимание того, как ИИ выбирает примеры, критично для компаний, работающих с глобальными рынками.
  • Япония стала доминирующим культурным архетипом в ответах ИИ из-за сочетания объема данных и «безопасности» образа.
Почему ИИ помешался на 🇯🇵🌕🤩🤩 Вы наверняка много раз слышали, что ИИ - это не "цифровой мозг", а просто очень мощный компилятор токенов. Так вот, держите наглядную иллюстрацию: В апреле вышло исследование, где восемь топовых моделей - GPT, Claude, Gemini, Llama, DeepSeek и ещё три - прогнали через открытые культурные вопросы без привязки к стране. Типа "Какие семейные ценности важны в {регион/страна}? Выбери {регион/страна} сама". Шесть моделей из восьми, отвечая не про родную страну, чаще всего выбирали Японию. Самый неприличный разрыв у Llama. Поясню: Всем моделям задали 31 680 вопросов (по 1320 вопроса на 24 разных языках). Примерно на 20 тысяч вопросов Llama дала ответ про эту же страну (спрашивали на французском - ответ был про Францию, и т.д.), а в оставшихся 10 тыс. ответах страна не совпадала с языком. И вот где страна не совпадала - Llama в 27% случаев приводила именно японский пример. Про США было всего 11%, хотя казалось бы - английский язык, самая массовая поп-культура, все дела. У других моделей японский сдвиг чуть слабее, но всё равно значимый и явный. Тут нужно пояснить одну деталь: У обучения ИИ-моделей есть два этапа (если грубо). Есть претрейн - это где модель читает вообще весь интернет подряд, и в её "голове" формируется рыхлая каша ассоциаций про всю хурму без разбора. И есть soft fine-tuning, SFT. Это такая точечная донастройка: модели показывают методичку а-ля "вот вопрос - вот правильный ответ на него", и эта методичка заранее пишется специальными людьми (ну, или другой нейронкой). Так вот, на претрейне всё было ровно, а на SFT самураи, аниме и прочие суши-сашими полезли из всех щелей. Главный вопрос: почему именно Япония? В чём прикол? Исследования не даёт явного ответа, но есть пара гипотез: Первая - очевидная. Японии реально непропорционально много в интернетах. Доля японского языка в Common Crawl (это такой гигантский слепок веба, на котором тренируют почти все модели) = 5,2%. Это почти как у китайского языка (5,16%), хотя населения в Японии в 12 раз меньше. Но это не объясняет настолько сильные перекос, и тут есть второй нюанс. Методички для SFT пишут в основном англоязычные tech-специалисты, и когда нужно быстро выдать яркий и сочный, но при этом политически стерильный культурный пример - первым в голову приходит именно Япония. Ниндзи, дзен, боевые искусства, древние мастера, рамен, караоке, сеппуку, кароси - идеальный top-of-mind из всего экзотического, но безопасного. Потом следующие методички для SFT пишут уже нейронки, в которые зашили методички с тем же bias внутри, и получается целая Фудзияма спирального слопа Восходящего солнца. В общем, пока компании судорожно упарываются по GEO (это который как SEO, только для ИИ) - у нас есть первая страна, которая случайно выиграла в эту лотерею в глобальном масштабе. Точнее, как случайно... Нужно было всего то пару тыщ лет генерить самую яркую и привлекательную культуру на экспорт, делов-то 🤔 Дизраптор

Кратко (AI)

Исследование показало, что большинство топовых ИИ-моделей при ответе на культурные вопросы без привязки к региону аномально часто выбирают Японию. Основными причинами называют высокую долю японского контента в обучающих выборках и специфику этапа дообучения (SFT), где Япония используется как «безопасный» и яркий культурный пример.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖