数字生态系统正在迅速变异。我对最新数据的分析显示:在公开访问的网页中,大约每十页就有一页带有明显的生成式人工智能痕迹。然而,这只是冰山一角——如果过滤掉大型语言模型时代之前创建的“史前”内容,对于传统作者来说,情况会变得更加令人担忧。

现象规模:从10%到34%

我研究了2026年7月收集的10,000个随机英语页面的样本。方法论基于机器学习,识别生成模型特有的语言模式。在所有页面中,“合成内容”的比例约为10%。但这只是整体平均水平。

关键洞察在于其他方面。如果仅考虑2022年11月ChatGPT首次亮相后发布的材料,超过三分之一的页面显示出人工智能创作的迹象。这意味着我们观察到的不仅仅是趋势,而是互联网内容生产的根本性转变,并且随着每一款新模型的推出——从Claude到Gemini——这一转变正在加速。

合成内容的地理分布:商业领域领先

人工智能内容在不同域名区域的分布极不均匀,这符合规律。在.com区域,每十页中就有一页显示出生成痕迹,是.org区域(4.6%)的两倍。在学术资源(.edu)和政府门户网站(.gov)上,这一比例降至微不足道的1%。

这种不平衡可以用内容经济学来解释。商业平台积极自动化日常任务:产品描述、SEO文本、参考文章和新闻简报。正是这些格式最容易自动化,而独特的研究和官方文件则需要人工参与。

方法论细节

需要强调的是:这一评估并非精确统计,而更像是一种概率模型。研究人员没有分析编辑历史,也没有采访作者。该方法捕捉的是与人工智能生成统计相关的语言标记。此外,该类别既包括完全生成的文本,也包括经过大量人工智能编辑的材料。轻度校对不在此列。

我的评论:这些数字是对整个行业的警钟。我们正在走向一个搜索引擎和读者都将淹没在模板化内容洪流中的世界。讽刺的是,高质量的人类文本将成为稀缺资源,因此获得溢价价值。问题不在于人工智能是否会取代作者,而在于谁能提供算法无法复制的独特专业知识。