数字景观正在迅速转型:我对最新数据的分析显示,互联网上大约10%的网页带有明显的机器生成或深度编辑痕迹。然而,更令人担忧的数字隐藏在动态变化中——在ChatGPT首次亮相后发布的材料中,合成内容的比例超过了33%。
扩张规模:从10%到三分之一
在研究中,分析了从2026年7月通过Common Crawl档案收集的10,000个英语页面的随机样本。识别过程中使用了一种机器学习模型,该模型专门用于寻找生成式神经网络特有的语言模式。乍一看,10%是一个适中的指标,但它包含了在先进LLM时代之前创建的大量“史前”内容。
如果过滤掉这些遗留内容,仅关注2022年11月之后出现的出版物,情况就会发生根本性变化。超过三分之一的此类页面显示出AI创作的高概率。这直接证明了生成模型已成为网络大部分文本生产的主要工具。
合成内容的分布:商业领域领先
AI内容在不同域名区域中的分布极不均匀,这表明了技术的务实应用。在.com区域中,大约每十个页面中就有一个显示出生成痕迹。相比之下,在非商业的.org区域中,这一比例低了一半——为4.6%。最“干净”的仍然是教育(.edu)和政府(.gov)资源,其中合成内容的比例仅勉强达到1%。
这种差异是可以解释的:商业平台积极自动化创建SEO文本、产品卡片和新闻推送。在ChatGPT传播初期,各区域之间的差距很小,但如今市场已根据AI采用程度明确细分。
方法论上的谨慎
重要的是要理解这一评估的局限性。该研究不检查每个页面的编辑历史,也不询问作者。结论基于对与AI生成相关的语言标记的统计分析。这是一个概率评估,而非精确计数。此外,“大幅编辑”内容的类别排除了轻微校对,这使得评估甚至有些保守。
我的评论:市场已经过了不可逆转的临界点。我们看到的不仅仅是趋势,而是内容经济中的根本性转变。然而,利用AI追求数量的竞赛带来了信息贬值和“数字噪音”增长的风险。在未来几年,关键资产将不再是生成速度,而是对来源的信任和数据验证的质量。能够建立混合编辑流程(AI增强而非替代分析)的参与者将获得决定性优势。