生成式神经网络在网络内容中的渗透程度远比人们普遍认为的要深得多。我对最新数据的分析显示:在所有现有网页中,约有10%带有明显的合成生成或算法大幅编辑的痕迹。然而,最令人担忧的指标是——在ChatGPT首次亮相后发布的材料中,此类内容的占比超过了三分之一。

方法论与关键数据

在研究中,我们分析了通过Common Crawl存档于2026年7月收集的10,000个随机英语页面的样本。识别过程使用了机器学习模型,该模型专门用于搜索现代LLM特有的语言模式。

在整个数据集中,只有十分之一的页面带有AI痕迹,这一事实可能具有误导性。这是因为样本中包含了大量在生成式AI时代之前创建的“遗留”内容。如果过滤掉历史层,仅关注2022年11月之后发布的出版物,情况就会发生根本性变化:超过33%的新页面在某种程度上是由神经网络创建或编辑的。

AI在哪些领域如鱼得水

合成内容在不同域名区域中的分布极不均衡,这说明了诸多问题。在.com区域中,约有十分之一的页面检测到AI痕迹。相比之下,.org中的这一比例为4.6%,而在学术(.edu)和政府(.gov)域名中约为1%。

这种不均衡是合乎逻辑的。商业领域历来依赖大量内容——产品描述、SEO文本、新闻推送。正是这些格式最容易实现自动化,我们在实践中也观察到了这一点。在ChatGPT热潮初期,各区域之间的差距并不那么明显,这表明合成内容的商业化正在加速。

重要说明

需要强调的是,这项研究并非针对每个具体页面的“谎言检测器”。该方法评估的是概率,而非使用AI的确切事实。我们讨论的是机器干预程度较高的文本;神经网络进行的轻微修改或校对很可能未被检测到。

我的评论:这些数字只是冰山一角。据我估计,到目前为止,新内容中合成内容的占比已经超过了50%,尤其是在新闻聚合器和细分博客中。我们正在走向一个不可逆转的临界点,届时搜索算法和推荐系统将被迫完全重新审视排名标准,否则它们将淹没在生成的噪音洪流中。问题不在于互联网是否会变得合成化,而在于我们如何学会去伪存真。