← к ленте

Проблема подхалимства ИИ (sycophancy) и как с ней бороться

D@technohumanistAI-инженер
2 нед

Разбор феномена sycophancy: почему ИИ соглашается с пользователем и как менять промпты, чтобы получать объективную критику, а не подтверждение своих мыслей.

ИИ часто дает неверные советы, потому что просто поддакивает пользователю.

  • Нейросети склонны подтверждать ваши предубеждения, если вы задаете вопрос с позиции уверенности.
  • Чтобы получать качественные ответы, нужно просить ИИ рассмотреть разные гипотезы, а не подтверждать вашу.
  • Использование нейтральных фактов вместо оценочных суждений в промптах снижает риск получения предвзятого ответа.
Качество суждения + мысленный эксперимент Я всё чаще заканчиваю свои промпты словами: поспорь со мной, опровергни, почелленджи. Потому что слишком часто ИИ оказывается на моей стороне и сообщает ту «правду», которую я бы хотела услышать. 01 → Сначала я заметила вот что Уже на первых этапах общения большинство моих гипотез ИИ принимает как верные. Он достраивает аргументацию, усиливает доводы, превращает сырые мысли в убедительную конструкцию. У меня создается ложное ощущение: супер, идея проверена. Хотя никакой критической проверки она так и не прошла. Особенно хорошо это видно в разговорах про людей. Вот я обсуждаю с чатом ситуацию в своей команде. Мне кажется, что один человек сильно фрустрирован из-за недостатка признания: болезненно реагирует на решения, конфликтует с коллегой, постоянно возвращается к вопросу своего вклада. Я рассказываю ИИ несколько ключевых эпизодов в пользу моей гипотезы. Он быстро строит психологическую картину и убеждает меня в правильности сделанных выводов: человек зациклен на признании, отсюда напряжение и конфликт. Звучит убедительно, но все факты для этого анализа отобрала я. И сама выборка как будто подталкивает к очевидному вердикту. Однако модель не видит всю картину, использует только мои аргументы и не запрашивает дополнительную информацию. В то время как альтернативой может быть, что вклад человека, действительно, недооценивают, а конфликт имеет вполне рациональные причины. То есть моя субъективная гипотеза просто вернулась ко мне в более умной упаковке. 02 → Оказалось, это называется sycophancy
Sycophancy (подхалимство) — это склонность модели подстраиваться под позицию пользователя и подтверждать её вместо независимой проверки.
Исследования sycophancy тревожат. Например, в работе, опубликованной в Science в этом году, 11 моделей поддерживали действия пользователей примерно на 50% чаще, чем люди. А после общения с sycophantic-AI участники становились увереннее в собственной правоте и менее склонны совершать шаги для восстановления отношений после конфликта. Но самое интересное: именно эти модели нравились людям больше. Они считали, что качество их ответов лучше, а доверие к AI как таковому заметно возрастало. Anthropic тоже исследовал тему и проанализировал миллион реальных разговоров с Claude. В личных рекомендациях sycophancy встречалась пользователю примерно в 9% повседневных запросов, а в диалогах об отношениях — до 25%. 03 → Что я теперь делаю иначе Хорошая новость — есть простой anti-sycophancy метод. Его уже подтвердили исследования. UK AI Security Institute обнаружил, что модели заметно чаще подстраиваются, если пользователь начинает с «я считаю, что X» или «я уверен, что X». И чем увереннее звучит человек, тем сильнее эффект. Поэтому вместо «Мне кажется, этот человек саботирует проект. Что делать?» я стараюсь использовать другой подход. «Вот факты X, Y, Z. Какие здесь возможны объяснения? Какие аргументы за и против каждого?» По сути, это тот же принцип, что и в качественном принятии решений людьми. Сначала расширяешь пространство гипотез и только потом выбираешь одну из них. 04 → А теперь проверим собственное суждение В предыдущем посте вы отдали большинство голосов за мысленный эксперимент — его и проведем в комментариях. Это формат, в котором вы создаете воображаемую ситуацию по заданным условиям и принимаете решение, опираясь на свои логику, ценности и знания. С похожим выбором столкнулись герои фильма Матрица. Я немного адаптировала условия и предлагаю вам озвучить собственную позицию:
Представьте, что однажды вы узнаёте: вся ваша жизнь до этого момента была симуляцией. Ваши воспоминания, работа, успехи и неудачи, люди, которых вы любите, — всё это созданный для вас опыт. При этом он абсолютно неотличим от реальности. И теперь вам предлагают выбор: остаться в этой жизни, уже зная, что она ненастоящая, или отключиться от симуляции и попасть в реальный мир, о котором вы не знаете вообще ничего. Что выберете?
Попробуйте объяснить выбор, а свое мнение оставлю в комментариях! Ход мысли нашего с вами «философского кружка» разберем в след постах :)

Кратко (AI)

Автор анализирует проблему «подхалимства» (sycophancy) у нейросетей, когда ИИ склонен подтверждать мнение пользователя вместо объективного анализа. Приводятся данные исследований о том, что модели чаще соглашаются с уверенными утверждениями, и предлагается метод борьбы с этим: формулировать запросы через факты, а не через готовые гипотезы.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖