生成式神经网络在网络空间中的渗透规模远比人们普遍认为的要大得多。我对最新数据的分析显示:互联网上大约每十个网页中就有一个带有明显的机器生成或深度编辑痕迹。然而,这只是冰山一角——如果只考虑2022年11月ChatGPT首次亮相后发布的内容,情况就变得真正令人担忧:此类页面中已有超过33%显示出合成来源的迹象。
方法论与现象规模
这些结论基于对2026年7月收集的10,000个英语页面的代表性样本的分析。识别过程中使用了一种机器学习模型,该模型经过调整,专门用于检测现代LLM特有的语言模式。需要明确的是:总体统计中也包含了在生成式AI时代之前很久创建的“旧”网络内容,这解释了绝对数字中相对温和的10%。
动态趋势显而易见:合成内容占比的增长与ChatGPT、Claude、Gemini及其同类产品的扩张直接相关。这些工具的应用范围越广,它们产生的内容就越多。
AI在哪里如鱼得水?
机器文本在不同域名区域中的分布极不均衡且具有指示性。商业领域(.com)领先,约占10%的页面。这比非商业领域.org(4.6%)高出两倍。而教育(.edu)和政府(.gov)资源则几乎完全“干净”——合成内容仅占约1%。
这种两极分化是可以解释的:商业网络以流量和SEO为导向。产品描述、参考文章、新闻推送——这些都是自动化的理想场所。而学术和政府领域对作者身份和验证有更高的要求,这抑制了对神经网络的盲目使用。
重要说明
需要强调的是:这里涉及的并非精确计数,而是概率性评估。该方法不涉及检查编辑历史或询问作者。分析依赖于统计语言标记,这些标记既可能是生成的明显迹象,也可能是风格化的结果。此外,在“由人类撰写或大幅编辑”的类别中,不包含人类对文本的轻度校对。
我的评论:我们正站在根本性变革的门槛上。网络正迅速转变为一个合成内容成为常态而非例外的环境。这不仅对信息的可信度提出了质疑,也对内容经济本身提出了挑战:搜索算法和广告网络已经无法有效过滤垃圾信息。像Anthropic推出的那种标记倡议,只是第一步,而且是谨慎的一步。如果没有全球性的验证和识别标准,我们可能会淹没在大量看似合理但毫无意义的信息海洋中,人类的声音最终将被机器彻底淹没。