对全球网络空间的分析展示了生成式模型的惊人扩张。根据我的数据,基于对2026年7月收集的10,000个英语页面的随机抽样的大规模研究,约10%的所有已索引内容带有明显的机器生成痕迹。然而,关键结论更为深刻:在2022年11月ChatGPT发布后发布的材料中,合成文本的比例超过33%。
方法论与现象的真实规模
用于识别的方法是分析现代LLM特有的语言模式的机器学习模型。重要的是要理解,将“史前”内容纳入样本会人为地拉低总体百分比。如果过滤掉生成式AI时代之前创建的所有内容,情况就变得激进:互联网上每三个新文本中就有一个是算法的产物。这不仅仅是统计数据,更是信息生产方式范式转变的标志。
商业领域——AI的主要战场
合成内容在不同域名区域的分布证实了经济动机。在.com区域,每十个页面中就有一个(10%)检测到AI痕迹,是.org区域(4.6%)的两倍。学术和政府资源(.edu和.gov)的数据更具说明性——那里的比例不超过1%。这种不平衡是可以解释的:商业平台积极自动化生产SEO文本、商品描述和新闻推送,在这些领域,速度和数量比独特的作者视角更重要。
重要说明与隐藏风险
需要强调的是,这里讨论的是对可能作者身份的评估,而非经过验证的事实。该方法不检查编辑历史,也不询问作者,因此可能存在双向误差。此外,“经大量编辑的”AI内容类别是模糊的:神经网络对语法的轻微修正可能不会被纳入样本,而完全生成的文章则会被纳入。
我的分析:市场已经面临对文本内容的信任危机。AI在商业领域占比的上升不可避免地导致信息噪音的贬值和过滤器的加强。我们正站在一个门槛上,算法将开始积极对抗其他算法的内容,在这场战争中,最大的输家可能是活生生的读者,他们正在失去区分事实与貌似可信的生成内容的能力。