生成式模型在网络空间中的渗透规模远比人们普遍认为的要大得多。我基于2026年7月通过Common Crawl收集的10,000个英文页面的样本进行的数据分析显示:整个互联网中约有10%的内容带有明显的合成生成痕迹。然而,这只是整体平均数据——由于大量在现代LLM时代之前创建的过时内容的存在,这一数字掩盖了真实情况。
ChatGPT之后的临界转变
关键洞察在于动态变化。如果过滤掉2022年11月(ChatGPT发布之时)之后发布的页面,这些数字就变得真正令人担忧。网络上所有新内容中超过三分之一显示出机器创作或神经网络大幅编辑的迹象。这不仅仅是统计数据,更是信息格局根本性转变的标志,算法已成为文本的主要生产工厂。
合成内容的分布:商业VS学术
AI内容在不同域名区域中的分布揭示了清晰的规律。在.com区域中,此类页面的比例达到10%——是.org区域(4.6%)的两倍。与学术和政府部门的差距更为显著:在.edu和.gov中,这一比例勉强达到1%。值得注意的是,在ChatGPT普及初期,这些差异几乎不明显,这表明商业平台正在迅速适应内容自动化:包括产品描述、SEO文本和新闻推送。
方法论上的谨慎
理解这一评估的局限性很重要。该分析依赖于与生成模型统计相关的语言标记,而非对每个页面创建历史的验证。这是一种概率性评估,而非精确计数。此外,该类别既包括完全生成的内容,也包括经过AI大幅编辑的材料,这为关于“共同创作”本质的讨论留下了空间。
我的评论:这些数字只是冰山一角。合成内容的实际比例可能更高,因为模型变得越来越完善,其输出更难与人类文本区分。市场迫切需要验证和标记标准,否则我们可能会淹没在看似合理但无法验证的信息洪流中,对网络作为知识来源的信任将最终被彻底摧毁。