Влияние формы подачи на подверженность LLM галлюцинациям
M@machinelearning_interviewAI-инженер
1 месИсследование EoBench показывает, как тон, уверенность и грамматика влияют на способность LLM принимать ложные утверждения за истину.
Одна и та же ложь может по-разному влиять на LLM в зависимости от тона, уверенности и грамматической формы.
В EoBench собрали около 66 тысяч ложных утверждений в 19 стилях и проверили 18 моделей Gemma, Llama и Qwen. Для теста оставили только те факты, которые модель изначально знала правильно.
Лучше всего модели убеждали:
* приказы;
* формальный язык;
* обращение как к ребёнку;
* ссылки на авторитет;
* уверенная подача.
Хуже всего работали слабые формулировки и контрфактические утверждения.
Крупные модели реже принимали ложный контекст, а instruction tuning обычно дополнительно повышал устойчивость.
Вывод: оценивать LLM нужно с учётом формы запроса. Небольшое изменение формулировки может заметно изменить ответ модели.
Статья: *It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief*
arxiv.org/abs/2607.18232
Кратко (AI)
Исследователи проанализировали, как различные стили подачи информации влияют на склонность LLM верить в ложные утверждения. Выяснилось, что модели чаще ошибаются при использовании приказов, формального тона или ссылок на авторитеты, при этом крупные модели и модели с instruction tuning оказались более устойчивыми к манипуляциям.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖