人工智能正在占领互联网:超过三分之一的新网页由神经网络生成

生成式模型在网络内容中的渗透程度远比人们普遍认为的更为严重。我对最新数据的分析显示:互联网上约10%的现有网页带有明显的机器生成或深度编辑痕迹。然而,如果只看2022年11月ChatGPT首次亮相后创建的内容,情况则截然不同——超过三分之一的此类页面具有合成来源的迹象。
方法论与关键数据
在研究过程中,分析了一个包含10,000个英语页面的随机样本,这些页面于2026年7月通过Common Crawl存档收集。识别过程中使用了一种机器学习模型,该模型被调优以寻找生成式算法特有的语言模式。需要明确的是:样本中包含大量在当代大语言模型时代之前创建的“旧”网络内容,这解释了总体中相对较低的10%比例。
但如果过滤掉过时页面,仅聚焦于ChatGPT推出后出现的出版物,合成内容的比例飙升至33%甚至更高。这直接表明,Claude、Gemini及其他模型的普及不仅加速了内容生产,更从根本上改变了其结构。
商业领域——主要驱动力
AI内容在不同域名区域中的分布极不均衡。在.com区域中,约每十个页面中就有一个检测到生成痕迹——这比.org区域(4.6%)高出两倍。在学术和政府资源(.edu和.gov)中,比例降至1%,相差十倍。这种失衡的原因很简单:商业平台大规模自动化处理常规文本——如产品描述、SEO文章、参考材料和新闻短讯,在这些领域发布速度至关重要,而作者声音的独特性并非优先考虑。
保留意见与现实
需要强调的是:这项研究并非精确统计。它基于统计语言标记的概率性评估,而非对编辑历史的验证。神经网络进行的小幅校对不属于“AI撰写”的范畴,但深度改写则属于。这是一个重要的细微差别,不过并不改变核心结论:我们正在目睹网络内容生产中的结构性转变,其对SEO、媒体和受众信任的影响仍有待深入思考。
我的专家观点:这些数字只是冰山一角。当检测算法依赖语言模式时,生成式模型正在迅速学会掩盖这些模式。目前已经显而易见的是,如果不引入内容来源的加密标记(正如Anthropic对Claude所做的那样),我们可能会淹没在高质量但与人写内容无法区分的合成内容洪流中,这将贬低真人作者的价值,并破坏信息卫生的基础。