我最近对数字领域的观察揭示了一个令人不安但意料之中的趋势:互联网上大约10%的网页带有明显的机器创作痕迹。然而,这只是冰山一角。如果深入挖掘并去伪存真,情况会变得更加激进。
生成式内容的热潮
通过对2026年7月收集的10,000个随机英语页面样本进行分析,我发现一个经过训练以识别生成式神经网络语言模式的统计模型,几乎在处处都能找到它们的痕迹。10%的总数字可能看起来微不足道,但它被大量在ChatGPT时代之前创建的“史前”内容所稀释。
关键洞察在于另一个方面:如果仅考虑2022年11月之后发布的材料,带有AI创作特征的页面比例飙升至三分之一。这直接证明了合成内容的指数级增长与ChatGPT、Claude、Gemini及其后继者的普及密不可分。
合成内容的地理分布:商业领域领先
AI内容在不同域名区域中的分布遵循着严格的市场逻辑。在.com商业领域,大约每十个页面中就有一个带有生成痕迹——这比非商业的.org区域(4.6%)高出两倍。教育(.edu)和政府(.gov)资源则几乎保持纯净——约为1%。
这种不平衡是可以解释的:企业正在积极自动化常规文本流程——如产品描述、SEO文章和新闻推送,在这些场景中,速度比作者声音的独特性更重要。在AI工具热潮初期,这些差异并不明显,但现在市场已经明确分层。
方法论上的谨慎
需要强调的是:这项研究并非“测谎仪”。我们无法访问每个文件的创建历史,也没有采访作者。分析基于与AI生成统计相关的概率性语言标记。这更像是对趋势的评估,而非精确计数。此外,这里指的是完全生成或大幅编辑的文本;神经网络进行的轻微校对不在此列。
我的结论:我们正在目睹信息生产中的结构性转变。市场已经适应了新现实,合成内容已成为商业网络的主要“原材料”。问题不在于这一过程是否会停止,而在于搜索算法和读者如何学会过滤这股洪流,将真正有价值的内容与机器智能的无尽回声区分开来。