Более трети веб-страниц, опубликованных со времени релиза ChatGPT, имеют явные признаки генерации ИИ или глубокой машинной редактуры. К такому выводу пришли исследователи Pew Research, проанализировав с помощью классификаторов Open Pangram около полумиллиона англоязычных страниц из архива Common Crawl за пять лет. Если в общем срезе за июль 2024 года доля синтетического текста держалась на уровне 10% из-за старого контента, то среди материалов, созданных после запуска ChatGPT, машинное авторство достигло 35%.

Основной приток синтетики обеспечивают коммерческие домены. В зоне `.com` доля сгенерированного контента оказалась примерно в десять раз выше, чем на сайтах `.edu` и `.gov` (около 1%), в то время как в зоне `.org` показатель составил 4,6%. Помимо доменных метрик, исследование зафиксировало всплеск характерных стилистических маркеров алгоритмов — в частности, злоупотребление длинными тире и оксфордскими запятыми.

Для руководителей AI-разработки и корпоративных лабораторий подобное замусоривание сети напрямую угрожает пайплайнам предобучения. По мере истощения созданных людьми эталонных данных загрузка нефильтрованных веб-дампов в базовые модели нового поколения грозит системным коллапсом: ускоренной деградацией логики рассуждений, накоплением галлюцинаций и резким ростом бюджетов на очистку датасетов. На фоне данных Cloudflare о том, что автоматический трафик уже превысил человеческий, индустрия стремительно движется к парадоксальному тупику: боты собирают синтетический мусор, сгенерированный другими ботами, чтобы обучать модели, которые будут работать всё хуже.

Генеративный ИИБольшие языковые моделиМашинное обучениеБезопасность ИИ