Учёные из трёх ведущих университетов провели эксперимент: участникам задавали сложные вопросы (в том числе о деталях фильмов) и разрешали в любой момент ответить «не знаю». Одной группе давали доступ к языковой модели Step 3.5 Flashi — по данным источников, она справлялась с этими вопросами хуже всех.
Результат: с помощью LLMi люди отвечали на больше вопросов, но точность резко упала, а уверенность в своих (часто неверных) ответах выросла. Модель не заполняла пробелы в знаниях, а превращала верные интуитивные догадки и восстанавливаемые из памяти ответы в ошибки.
28% → 9%точность ответов без/с LLM (по @kyrillic)
30% → 76%уверенность в ответах без/с LLM
40% → 3-6%доля ответов «не знаю» без/с LLM
- По данным @kyrillic: точность ответов упала с 28% до 9%, уверенность выросла с 30% до 76%
- По данным канала «Нейросети»: без ИИ верно ответили 27% участников, с подсказками ИИ — только 9%; ошибки утроились, уверенность выросла вдвое
- Без LLM ответ «я не знаю» на сложные вопросы давали 40% (по @kyrillic) или ~44% (по каналу «Нейросети»); с LLM — только 3-6% (у @kyrillic) или 3% (у «Нейросети»)
- Использовалась модель Step 3.5 Flash, которая, по данным источника, проходила тесты хуже всех остальных моделей
- Автор @kyrillic отмечает: гугление создаёт больше трения (нужно открыть ссылки, прочитать, сопоставить), а LLM выдаёт готовый на первый взгляд надёжный ответ, в который хочется поверить сразу
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖