生成式模型在网络内容中的渗透程度远比人们普遍认为的更为严重。我对皮尤研究中心最新数据的分析显示:互联网上大约10%的网页带有由人工智能创建或深度编辑的文本痕迹。然而,关键数字隐藏得更深——在ChatGPT首次亮相后发布的材料中,合成内容的占比超过三分之一。
人工智能正在占领新页面
研究人员研究了通过Common Crawl于2026年7月收集的10,000个英语页面的随机样本。为了识别作者身份,他们使用了一种机器学习模型,该模型经过训练能够识别生成式神经网络的典型语言模式。乍一看,10%是一个不起眼的数字,但它包含了在现代LLM时代之前创建的大量历史内容。
当我过滤掉旧有内容,只关注2022年11月之后出现的页面时,情况发生了根本性变化。这些页面中超过三分之一显示出明显的AI生成迹象。这证实了:合成内容的增长与ChatGPT、Claude、Gemini及其竞争对手的扩张直接相关。
商业领域是AI的主要战场
AI内容在不同域名区域中的分布极不均衡,反映了经济激励因素。2026年,.com区域中每十个页面就有一个带有神经网络痕迹——这比.org区域(4.6%)高出两倍。在教育(.edu)和政府(.gov)资源上,这一比例降至1%,比商业领域低十倍。这种差距的解释很简单:商业网站大量发布产品描述、SEO文章和新闻,这些内容很容易实现自动化。在ChatGPT时代初期,这些差异并不明显,但现在市场已经清晰分层。
方法论上的细微差别
需要强调的是:皮尤并未核查每个页面的创建历史,也未询问作者。该分析基于与AI生成相关的统计语言标记。因此,结果应被解读为对可能作者身份的估计,而非精确统计。此外,这里讨论的是“撰写或大幅编辑”的内容——神经网络进行的小幅修改不在此列。
值得注意的是,Anthropic已在8月对Claude生成的内容引入全球标记,这进一步证实了问题的系统性。
我的结论:这些数字不仅仅是统计数据,而是信息生产领域发生结构性转变的信号。市场正迅速走向混合内容,人机作者身份之间的界限正在模糊。对于投资者和分析师而言,这意味着未来几年需要重新评估网络资产的质量以及虚假信息的风险。