Учёные из трёх ведущих университетов провели эксперимент: участникам задавали сложные вопросы (в том числе о деталях фильмов) и разрешали в любой момент ответить «не знаю». Одной группе давали доступ к языковой модели Step 3.5 Flashi — по данным источников, она справлялась с этими вопросами хуже всех.
Результат: с помощью LLMi люди отвечали на больше вопросов, но точность резко упала, а уверенность в своих (часто неверных) ответах выросла. Модель не заполняла пробелы в знаниях, а превращала верные интуитивные догадки и восстанавливаемые из памяти ответы в ошибки.
ВыводПо данным @kyrillic: точность ответов упала с 28% до 9%, уверенность выросла с 30% до 76%
28% → 9%точность ответов без/с LLM (по @kyrillic)
30% → 76%уверенность в ответах без/с LLM
40% → 3-6%доля ответов «не знаю» без/с LLM