Аналитики Pew Research Centeri оценили долю веб-страниц, написанных или существенно отредактированных нейросетями, прогнав почти 490 000 англоязычных страниц из архива Common Crawli через модель-детектор машинного текстаi. Итог: среди страниц, опубликованных после выхода ChatGPT в конце 2022 года, признаки ИИ-авторства несёт около трети — и это меняет саму природу интернета как источника данных, на которых обучают будущие модели.
Возникает замкнутый круг: языковые модели учатся на вебе, а веб всё активнее заполняется текстами, которые сгенерировали сами модели. Со временем отделить человеческий текст от машинного становится всё труднее — как для будущих ИИ, так и для исследователей.
35%доля ИИ-страниц после выхода ChatGPT
490 000проанализированных англоязычных страниц
9,35%доля ИИ-контента в домене .com к 2026
- Для анализа собрали почти 490 000 англоязычных страниц из архива Common Crawl, датированных январём 2021 — июлем 2026 года; период до ноября 2022 (до релиза ChatGPT) использовался как контрольный, поскольку эти страницы физически не могли быть машинными
- В случайной выборке из 10 000 страниц за июль 2026 года значимые следы ИИ-авторства или существенной правки нашлись у 10%; после исключения страниц, опубликованных до конца ноября 2022 года, показатель среди пост-ChatGPT контента вырос до 33% и выше (по данным Source 1 — около 35%)
- В начале 2023 года доли ИИ-контента в доменах .com, .org, .edu и .gov были примерно одинаковы — около 1%
- К 2026 году домены разошлись: .com — 9,35%, .org — 4,59%, .edu и .gov — около 1% каждый
- Метод: специальная модель-детектор ловит статистические различия в построении фраз людьми и языковыми моделями; сама методика небезупречна — детектор может путать человеческий текст с машинным и наоборот, поэтому оценивать по ней отдельный документ нельзя, работает только статистика на больших выборках
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖