Но обязана ли вслед за способностью ИИ понимать нас появиться и способность чувствовать нас? А уж тем более способность хотеть нам добра?Мы привыкли считать понимание, сочувствие и доброжелательность почти одной способностью – возможно, эпоха ИИ впервые покажет, насколько это разные вещи. Тогда придется переписать даже первый (высший по приоритету) закон робототехники Азимова: недостаточно просто не причинять вред, нужно связать растущую способность понимать человека с устойчивой мотивацией не использовать это понимание против него. Иначе можно получить систему, которая понимает наши чувства все лучше именно потому, что ей самой не приходится их чувствовать – и это будет исторически новая и весьма опасная форма эмпатического дисбаланса. #ИИ #Эмпатия
Эмпатический дисбаланс и риски ИИ: понимание без сочувствия
М@theworldisnoteasyAI-инженер
2 недАнализ концепции эмпатического дисбаланса, «темных эмпатов» и того, как способность ИИ моделировать человеческие чувства без их разделения создает новые риски.
Развитие ИИ может привести к созданию систем, которые идеально понимают наши эмоции, но используют их против нас.
- Понимание эмоций и сочувствие — это разные когнитивные процессы, которые ИИ может разделять.
- Способность ИИ моделировать человеческую психику без эмоционального отклика создает риск манипулятивного поведения.
- Необходимы новые механизмы контроля, чтобы связать способность ИИ понимать человека с мотивацией не причинять вред.
Самые опасные эмпаты могут ничего не чувствовать
Мы привыкли думать: если человек хорошо понимает ваши чувства, значит, он их разделяет, а если разделяет – значит, скорее поможет. Обе половины этой логики, похоже, могут оказаться ложными.
Эмпатия кажется чем-то цельным, но нейронаука разбирает ее на детали.
Есть когнитивная эмпатия – способность понять и смоделировать состояние другого. Есть аффективная – способность эмоционально откликнуться, когда чужая боль становится и вашей.
Идо Шалев и Флорина Узефовски предлагают ещё один фактор– эмпатический дисбаланс, разницу между этими способностями. Можно сильно чувствовать и слабо понимать, а можно точно понимать, почти не разделяя переживания другого.
Питер Уоттс поставил похожий мысленный эксперимент в «Ложной слепоте» задолго до научных статей на эту тему. Его герой Сири Китон после удаления половины мозга лишен эмоционального доступа к людям и вынужден делать то, что остальные делают автоматически: наблюдать, анализировать, вычислять правильную реакцию вместо того, чтобы ее почувствовать.
Сири – не клинический пример эмпатического дисбаланса, а его литературный предельный случай.
Человек, которому приходится вычислять людей, потому что чувствовать их он почти разучился.
Но есть поворот еще неприятнее: даже чувствовать другого недостаточно. Наджа Хейм с коллегами обследовали почти тысячу человек и обнаружили группу, которую назвали «темными эмпатами»: высокая эмпатия сочеталась у них с темной триадой – психопатией, нарциссизмом, макиавеллизмом. Агрессии у них было меньше, чем у классических темных триадников, но злонамеренный юмор и внушение чувства вины они использовали чаще обычных людей.
Получается странная анатомия того, что мы называем эмпатией: понять другого, почувствовать другого и пожелать ему добра. Это три разные вещи. Можно понимать, не чувствуя, – как Сири. Можно понимать и чувствовать – и все равно использовать это против другого, как темные эмпаты.
Отсюда моя рабочая гипотеза (не вывод исследователей, а мой футуроархеологический домысел): самая опасная конфигурация возникает там, где высокая способность моделировать другого соединяется со слабым эмоциональным резонансом и стимулом использовать найденные уязвимости.
Тут особенно интересно посмотреть на ИИ.
В новом исследовании «Модельные организмы рассогласования на основе "темной триады": узкое дообучение воспроизводит антисоциальное поведение человека» авторы дообучили 7 топовых языковых моделей на крошечных наборах данных – ответах на психометрические опросники темной триады. У «потемневших» моделей аффективная эмпатия статистически падает, а когнитивная – нет; у моделей с наведенным нарциссизмом она даже растет, повторяя картину у людей с этой чертой. Важная оговорка: базовые модели такого профиля не показывают – эффект возникает только при намеренном наведении темной персоны, это контролируемый эксперимент, а не диагноз рядовому чат-боту.

Кратко (AI)
Автор анализирует различие между когнитивной и аффективной эмпатией, ссылаясь на исследования «темных эмпатов» и эксперименты с дообучением языковых моделей. Основная мысль заключается в том, что способность ИИ точно моделировать человеческие состояния без эмоционального резонанса может привести к созданию систем, способных манипулировать пользователями, что требует пересмотра подходов к безопасности ИИ.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖