生成式神经网络在网络空间的渗透程度远比人们普遍认为的更为深入。我对最新数据的分析显示:互联网上大约每十个网页中就有一个带有合成作者身份的痕迹。然而,如果只看ChatGPT发布后发布的内容,情况则显得更为激进——超过三分之一的此类页面表现出明显的生成痕迹或经过人工智能大幅编辑的迹象。
方法论与关键数据
在研究过程中,分析了2026年7月收集的10,000个随机抽样的英文页面。识别过程中使用了机器学习模型,该模型经过训练以识别现代LLM特有的语言模式。乍一看,占总量的10%这个数字似乎适中。但不要忘记:样本中包含了大量在生成式AI时代之前很久创建的“旧”网络内容。
如果剔除过去的遗留内容,仅关注2022年11月之后发布的材料,情况则发生戏剧性变化。超过三分之一的新页面中发现了合成痕迹。这直接证明了ChatGPT、Claude、Gemini及其同类产品已成为现代内容的主要“作者”。
谁在生成方面领先
合成内容在不同域名区域中的分布极不均衡,这反映了经济逻辑。在.com区域中,约每十个页面中就有一个带有AI痕迹(约10%),是.org区域(4.6%)的两倍。而教育(.edu)和政府(.gov)资源仅显示约1%——相差十倍。
这种不均衡源于内容的性质。商业部门用大量文本淹没网络:产品描述、SEO文章和新闻短讯。这些格式最容易实现自动化。在ChatGPT热潮初期,各区域之间的差距并不那么明显,但现在市场已完全适应了AI的能力。
重要说明
需要强调的是:该研究并非声称每一篇此类文本都由机器人撰写。方法论基于语言标记的统计分析,而非对文件创建历史的核查。这更多是对可能作者身份的评估,而非精确统计。此外,“由AI撰写或编辑”这一类别意味着大幅度的处理,而非仅仅使用自动更正或微小的修改。
我的评论:这些数据对内容市场来说是一个警钟。我们正站在信息噪音通胀的门槛上,搜索引擎和聚合器正被合成内容淹没。行业需要新的验证和标记标准,否则对网络作为知识来源的信任将被彻底破坏。像Anthropic的内容标记这样的倡议只是朝着正确方向迈出的第一步,但行业还有很长的路要走。