生成式人工智能渗透网络环境的规模远比人们通常认为的更为严重。我对最新数据的分析显示:在所有现有网页中,约有10%带有明显的合成作者痕迹。然而,这只是冰山一角——在ChatGPT首次亮相后发布的内容中,AI文本的比例已超过三分之一。

数字景观的新现实

在一项大规模研究中,分析了通过Common Crawl存档于2026年7月收集的10,000个英语页面的随机样本。识别过程中使用了一种机器学习模型,该模型经过调校,用于检测现代神经网络特有的语言模式。

10%的数字看似温和,但具有欺骗性。样本中包含大量在生成式模型时代之前创建的遗留内容。如果过滤掉历史层,仅聚焦于2022年11月之后发布的材料,情况将发生根本性变化:超过33%的新页面显示出AI生成的迹象。

商业领域——主要受影响区域

合成内容在不同域名区域中的分布极不均衡,这说明了诸多问题。商业领域.com位居首位,每十个页面中就有一个包含AI痕迹——这比.org(4.6%)高出两倍。教育(.edu)和政府(.gov)资源则干净十倍,约为1%。

这种不均衡是可以解释的:商业网站积极自动化生产产品描述、SEO文章和新闻短讯。这些是量大且模板化的格式,非常适合算法化处理。值得注意的是,在ChatGPT普及初期,各区域之间的差距微乎其微——而如今我们正目睹急剧的两极分化。

方法论细节与结论

需要强调的是:这项研究并非精确统计,而更接近一种概率性评估。作者未核查编辑历史,也未咨询网站管理员。分析依赖于统计语言标记,因此部分页面可能由人类撰写,但在风格上模仿了AI,或者反之——经过最低限度的编辑,未落入“实质性修改”的类别。

尽管如此,趋势显而易见:我们正在目睹互联网内容生产中的结构性转变。值得注意的是,在此背景下,Anthropic已为其Claude模型引入强制性标记——这一举措很可能成为行业标准。

我的评论:市场正站在内容“通胀崩溃”的门槛上。当三分之一的新页面由机器生成时,文本信息本身的价值急剧下降,而信任和来源验证则成为首要因素。这是对SEO行业和媒体的根本性挑战,将需要重新审视排名和版权的根本原则。