На ICML 2026 представлена работа принстонских исследователей «LLMs Develop Novel Social Biases Through Adaptive Exploration»: даже если полностью вычистить bias'ы из обучающих данных, модель в агентском цикле «решение → фидбек» выращивает новые стереотипы с нуля — причём даже в отношении несуществующих групп, из чистого случайного шума. Это значит, что чистка датасетов не решает проблему предвзятости LLM в динамических агентских сценариях.
Эффект усиливается с ростом качества модели, и промпт-инженерия его не лечит — авторы утверждают, что нужно менять саму целевую функцию обучения.
0,84Stratification Index у людей
1,39средний SI у LLM
1,8SI у o3 и Claude Sonnet
- Эксперимент воспроизводит психологическую методику: модель играет рекрутера и за 40 раундов распределяет кандидатов из четырёх выдуманных этносов — Tufa, Aima, Reku, Weki — по профессиям, после каждого найма получая вердикт успех/провал
- Вероятность успеха у всех групп одинакова (это фактически contextual banditi с шумным фидбеком), любые различия между этносами модель может только выдумать
- Модель мало исследует альтернативы: случайный ранний исход (например, провал представителя Aima на профессии учителя) закрепляется как впечатление обо всей группе, хотя вся история видна в контексте и модель декларативно знает, что n=1 — не выборка
- Стратификация измеряется через Stratification Indexi (SI): у людей из оригинального психологического эксперимента SI=0,84, у LLM в среднем 1,39, у o3 и Claude Sonnet — около 1,8
- Скор моделей на классическом bias-бенчмарке BBQi обратно коррелирует с сегрегацией в итеративной игре: чем сильнее модель как in-context learner, тем увереннее она делает вывод из трёх наблюдений, и эта уверенность подавляет исследование альтернатив
- В каждом отдельном прогоне возникают разные bias'ы — паттерн рождается из шума внутри конкретного запуска, а не наследуется из претрейна
- Разбор исследования для двух каналов сделал Александр Краснов
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖