生成模型在网络空间中的渗透规模远比人们通常认为的更为严重。我对最新数据的分析显示:互联网上大约每十个网页中就有一个带有明显的机器生成或大幅编辑的痕迹。然而,如果只看2022年11月ChatGPT首次亮相后发布的内容,情况则截然不同——超过三分之一的此类页面具有合成来源。

方法论与现象规模

在研究过程中,我们分析了通过Common Crawl档案于2026年7月收集的10,000个随机抽样的英文页面。识别过程中使用了机器学习模型,该模型专门用于搜索生成式神经网络特有的语言模式。10%的总体比例看似不高,但这一数字被大量在LLM时代之前创建的陈旧内容所稀释。

当我们剔除“史前”网络,仅聚焦于ChatGPT推出后出现的出版物时,我们看到了AI的迅猛扩张。三分之一的页面并非边缘小众,而是一个系统性趋势,随着Claude、Gemini及其他模型融入日常工作流程,这一趋势只会不断加剧。

商业领域——主要驱动力

合成内容在不同域名区域的分布凸显了这一现象的经济背景。在.com域名中,每十个页面就有一个检测到AI生成痕迹——这一比例是非商业.org域名(4.6%)的两倍。与教育及政府域名(.edu和.gov)的差距更为显著,后者比例勉强达到1%。

这种不均衡是合乎逻辑的:商业平台积极自动化创建商品描述、SEO文本和新闻推送。这些是量大且模板化的格式,速度和资源节省比独特的作者视角更为重要。在ChatGPT热潮初期,这些差异尚不明显,但如今市场已清晰分化。

方法论的重要说明

需要强调的是,这并非对“机器人所写内容”的精确统计,而是一种概率性评估。研究人员并未核查编辑历史,也未采访作者。分析依赖于统计语言标记,这些标记也可能出现在经过激进AI编辑的人类撰写的文本中。此外,使用神经网络进行的小幅修改通常不会被归入此类。

在此背景下,Anthropic最近关于对Claude生成内容进行全球标记的决定颇具启示性。行业开始意识到:如果没有对合成内容的明确识别,我们可能最终彻底失去事实与拟像之间的界限。

我的结论:我们目睹的不仅是趋势,而是内容经济中的一场结构性转变。网络正迅速演变为一个环境,在这个环境中,人类创作在廉价且千篇一律的机器内容洪流中成为高端产品。问题不在于是否有人能阻止这一进程,而在于我们如何调整搜索和信任算法以适应新的现实。