Треть новых веб-страниц создаются или редактируются искусственным интеллектом
Согласно последнему исследованию Pew Research, опубликованному в августе 2026 года, около трети веб-страниц, выпущенных после запуска ChatGPT в ноябре 2022 года, демонстрируют признаки того, что они были написаны или существенно отредактированы искусственным интеллектом. Это исследование совпадает с данными о том, что трафик от ботов теперь превышает человеческий, и подчеркивает фундаментальный сдвиг в ландшафте интернет-контента.
# Искусственный интеллект становится доминирующим автором в интернете
Издание Pew Research опубликовало данные, подтверждающие, что влияние языковых моделей на создание контента в сети стало массовым явлением. Более 30% новых страниц в интернете, созданных после появления ChatGPT, содержат следы работы ИИ. Это исследование пришло на фоне новостей от Cloudflare, которые подтвердили, что количество запросов от автоматизированных программ (ботов) превысило количество запросов от реальных пользователей.
Если ранее главной дискуссией был вопрос о том, *кто* читает новости в интернете, то сейчас фокус сместился на то, *кто пишет* эти новости. Исследование Pew показывает, что происходит взаимное взаимодействие: боты все чаще читают страницы, которые сами были сгенерированы другими ботами.
Методология и выборка данных
Для проведения анализа исследователи использовали архив Common Crawl, собирая около полумиллиона английских веб-страниц за последние пять лет. Ключевым моментом стало отсечение данных, предшествующих ноябрю 2022 года — моменту выхода ChatGPT для широкой публики. Это позволило исключить из выборки страницы, которые физически не могли быть созданы с помощью современных языковых моделей.
В общей случайной выборке из 10 000 страниц, собранной в июле 2026 года, признаки значительного авторства ИИ обнаружили примерно у 10% материалов. Однако эта цифра искажалась наличием в выборке старого контента. При фильтрации страниц, опубликованных после релиза ChatGPT, доля сайтов с явными следами участия искусственного интеллекта выросла до 35%.
Исследователи применяли технологию Open Pangram для детекции. Важно отметить, что, как и другие инструменты обнаружения ИИ, данная система может犯错误, иногда классифицируя человеческий текст как машинный. Тем не менее, в масштабах целой выборки данных, вероятно, верно указывают направление тренда.
Технические примечания
Следы авторства ИИ часто кроются в стилистике текста. Исследование отмечает рост использования определенных речевых маркеров, характерных для нейросетей. К ним относятся:
* Тире (em dashes): Частое использование длинных тире для разделения фраз, которые в традиционном русском стиле часто заменяются двоеточием или запятой. * Оксфордская запятая: Использование запятой перед союзом в перечислении, которое в бытовых текстах встречается реже. * Структурные фразы: Предпочтение конструкций типа «это не Х, это Y» вместо более мягких или вариативных формулировок, характерных для живого повествования.
Вариативность в зависимости от домена
Анализ также выявил резкую зависимость процента «машинного» контента от типа веб-домена. Результаты показывают значительный разрыв между коммерческими и образовательными/государственными ресурсами:
* Домены .com: Указывают на признаки авторства ИИ примерно в 10 раз чаще, чем другие типы доменов. * Домены .edu и .gov: Процент страниц с признаками ИИ составляет около 1% в обоих случаях. * Домены .org: Занимают промежуточное положение с показателем около 4.6%.
Эти данные могут указывать на то, что коммерческий сектор использует ИИ-инструменты для генерации массового контента более агрессивно, чем академические или государственные структуры, которые, возможно, придерживаются более строгих редакционных стандартов.
Реальность цифрового ландшафта
Полученные данные не просто статистика; они отражают реальную инфраструктуру интернета. Если мы говорим о том, что боты читают ботов, то этот цикл замыкается именно на таком контенте. Пользователю становится все сложнее отличить материал, написанный человеком, от текста, отредактированного алгоритмом, особенно в сфере новостных агрегаторов и блогов.
Уже сейчас мы наблюдаем ситуацию, когда редакторы и контент-менеджеры используют эти модели для черновиков, что неизбежно оставляет цифровой след. Исследование Pew напоминает нам, что интернет перестал быть исключительно пространством человеческого самовыражения и перерос в гигантскую сеть, где машины выступают главными акторами в создании информации. Это не обязательно означает падение качества, но это требует от пользователей и создателей контента большей критичности и внимательности к источнику информации.