biasСбросить фильтр ×

Почему ИИ-модели демонстрируют культурный перекос в сторону Японии

Д@disruptors_officialмедиа / агрегатор
4 нед

Исследователи из Принстона показали: LLM сами придумывают новые стереотипы в процессе работы

На ICML 2026 представлена работа принстонских исследователей «LLMs Develop Novel Social Biases Through Adaptive Exploration»: даже если полностью вычистить bias'ы из обучающих данных, модель в агентском цикле «решение → фидбек» выращивает новые стереотипы с нуля — причём даже в отношении несуществующих групп, из чистого случайного шума. Это значит, что чистка датасетов не решает проблему предвзятости LLM в динамических агентских сценариях.

Эффект усиливается с ростом качества модели, и промпт-инженерия его не лечит — авторы утверждают, что нужно менять саму целевую функцию обучения.

ВыводЭксперимент воспроизводит психологическую методику: модель играет рекрутера и за 40 раундов распределяет кандидатов из четырёх выдуманных этносов — Tufa, Aima, Reku, Weki — по профессиям, после каждого найма получая вердикт успех/провал

0,84Stratification Index у людей
1,39средний SI у LLM
1,8SI у o3 и Claude Sonnet

Полный разбор →

Это всё на сейчас.