生成式人工智能在互联网空间中的渗透规模远比人们普遍认为的更为严重。我对最新数据的分析显示:互联网上大约每十个网页中,就有一个带有明显的机器生成或大幅编辑的痕迹。然而,如果只看2022年11月ChatGPT发布后创建的内容,情况则截然不同——超过三分之一的此类页面具有AI创作的迹象。
方法论与现象规模
通过Common Crawl于2026年7月收集的10,000个随机英语页面的样本,使用机器学习模型进行了分析。该算法识别了生成模型在统计上具有典型特征的语言模式。需要强调的是:这不是精确统计,而是基于语言标记对可能作者身份的评估。
在“新近”发布的文章中,合成内容占比超过33%这一事实,表明信息生产领域正在发生结构性转变。ChatGPT、Claude、Gemini及其竞争对手已不仅仅是工具,而是成为相当一部分网页内容的主要“作者”。
商业领域——主要驱动力
AI内容在不同域名区域中的分布极不均衡。在.com区域中,约10%的页面检测到生成痕迹——这是.org区域(4.6%)的两倍。与学术和政府领域的差距更为显著:.edu和.gov区域中AI文本的比例仅约为1%。
这种不均衡是可以解释的。商业平台积极自动化生产商品描述、SEO文章和新闻简讯——这些格式易于通过神经网络进行规模化扩展。相反,对真实性和专业性要求较高的网站(教育、政府部门)则保持了“人类”创作。
重要说明与结论
必须做出重要补充说明:该研究并未核查页面的创建历史,也未对作者进行访谈。这里涉及的是概率性评估,而非已证实的生成事实。此外,“由AI撰写或大幅编辑”这一类别排除了轻度校对的情况,这使得评估结果趋于保守。
在此背景下,Anthropic最近引入对Claude生成内容进行全球标记的举措显得合情合理。然而,在我看来,这只是冰山一角。我们正在走向一个信息溯源验证与其内容本身同等重要的世界。市场需要新的真实性标准,否则对网络作为知识来源的信任将迅速瓦解。