Сколько машинного текста в интернете: исследование Pew Research Center
В@vselennayaplusисследователь
3 днАнализ доли ИИ-контента в интернете на основе данных Common Crawl и исследования Pew Research Center.
Интернет стремительно наполняется контентом, созданным нейросетями, что меняет качество информации в сети.
- Доля ИИ-текстов в интернете значительно выросла после 2022 года.
- Коммерческие сайты (.com) показывают гораздо более высокий уровень использования ИИ, чем образовательные или государственные ресурсы.
- Методы оценки ИИ-контента остаются вероятностными и не дают 100% точности для отдельных текстов.
Сколько в интернете машинного текста — и как это вообще посчитать
Вопрос кажется простым ровно до того момента, пока не задумаешься о методике. Веб нельзя опросить. У страницы нет графы «автор — нейросеть». Модель следов за собой не оставляет. Исследователи из Pew Research Center зашёл с единственной доступной стороны — через статистику языка на очень большом массиве.
Что делали. Из архива Common Crawl вытащили почти 490 000 англоязычных страниц, собранных с января 2021 по июль 2026 года. Нижняя граница выбрана не случайно: полтора года до выхода ChatGPT работают как контрольный период, с которым сравнивают всё дальнейшее. Тексты прогнали через специальную модель-детектор, натасканную ловить статистические различия в том, как строят фразы люди и как это делают языковые модели.
Результат. В срезе из 10 000 случайных страниц за июль 2026-го значимые следы машинного авторства или существенной ИИ-правки нашлись у 10%.
Изрядная часть страниц физически не могла быть машинной: их опубликовали до конца ноября 2022 года. Отфильтруйте всё, что вышло после релиза ChatGPT и показатель уходит за 33%.
Будь детектор просто шумом, он шумел бы везде одинаково. Но в начале 2023 года .com, .org, .edu и .gov держались примерно на одном уровне около процента, а к 2026-му разъехались: 9,35%, 4,59% и порядка 1% у двух последних. Расслоение началось ровно тогда, когда чат-боты стали массовыми, и это косвенный довод в пользу того, что модель ловит именно то, что должна.
Правда, всегда надо учитывать, что детекторы промахиваются в обе стороны — человеческий текст улетает в машинные, машинный проходит за человеческий. Поэтому отдельный документ такой оценкой характеризовать нельзя, работает только статистика на больших выборках. Да и сам детектор это тоже нейросеть, а не измерительный прибор с паспортом точности.
@vselennayaplus

Кратко (AI)
Исследователи Pew Research Center проанализировали массив данных Common Crawl, чтобы оценить долю ИИ-сгенерированного контента в сети. Выяснилось, что после запуска ChatGPT доля страниц с признаками машинного авторства выросла до 33% в соответствующих сегментах, при этом показатели сильно различаются в зависимости от доменной зоны.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖