← к умной ленте

Исследователи из Принстона показали: LLM сами придумывают новые стереотипы в процессе работы

На ICML 2026 представлена работа принстонских исследователей «LLMs Develop Novel Social Biases Through Adaptive Exploration»: даже если полностью вычистить bias'ы из обучающих данных, модель в агентском цикле «решение → фидбек» выращивает новые стереотипы с нуля — причём даже в отношении несуществующих групп, из чистого случайного шума. Это значит, что чистка датасетов не решает проблему предвзятости LLM в динамических агентских сценариях.

Эффект усиливается с ростом качества модели, и промпт-инженерия его не лечит — авторы утверждают, что нужно менять саму целевую функцию обучения.

0,84Stratification Index у людей
1,39средний SI у LLM
1,8SI у o3 и Claude Sonnet
  • Эксперимент воспроизводит психологическую методику: модель играет рекрутера и за 40 раундов распределяет кандидатов из четырёх выдуманных этносов — Tufa, Aima, Reku, Weki — по профессиям, после каждого найма получая вердикт успех/провал
  • Вероятность успеха у всех групп одинакова (это фактически contextual banditi с шумным фидбеком), любые различия между этносами модель может только выдумать
  • Модель мало исследует альтернативы: случайный ранний исход (например, провал представителя Aima на профессии учителя) закрепляется как впечатление обо всей группе, хотя вся история видна в контексте и модель декларативно знает, что n=1 — не выборка
  • Стратификация измеряется через Stratification Indexi (SI): у людей из оригинального психологического эксперимента SI=0,84, у LLM в среднем 1,39, у o3 и Claude Sonnet — около 1,8
  • Скор моделей на классическом bias-бенчмарке BBQi обратно коррелирует с сегрегацией в итеративной игре: чем сильнее модель как in-context learner, тем увереннее она делает вывод из трёх наблюдений, и эта уверенность подавляет исследование альтернатив
  • В каждом отдельном прогоне возникают разные bias'ы — паттерн рождается из шума внутри конкретного запуска, а не наследуется из претрейна
  • Разбор исследования для двух каналов сделал Александр Краснов

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖