我最近对网络空间的观察证实了一个结构性的转变:生成式模型正迅速成为现代互联网的主要“作者”。我能够分析的最新数据显示,目前所有现有网页中约有10%带有明显的合成生成痕迹。然而,更令人担忧的数字隐藏在动态变化中:如果只看2022年11月ChatGPT首次亮相后发布的内容,AI文本的比例超过了三分之一。

方法论与现象规模

在研究过程中,我处理了通过Common Crawl在2026年7月收集的10,000个英语页面的随机样本。为了识别,我使用了一种机器学习模型,该模型被调优以寻找生成式架构特有的语言模式。需要强调的是:这10%只是冰山一角,因为样本包含了大量在神经网络的现代时代之前创建的过时内容。

当我过滤掉“史前”页面,并仅关注ChatGPT推出后出现的材料时,情况发生了根本性变化。超过33%的新页面显示出统计上显著的AI干预迹象。这直接证明了合成内容正随着Claude、Gemini及其他竞争对手的普及而呈指数级增长。

商业领域——AI的主要战场

合成内容在不同域名区域中的分布极不均匀。到2026年,.com区域中每十个页面就有一个包含AI生成内容,是.org区域(4.6%)的两倍。教育和政府资源仍然是最“干净”的——那里的比例不超过1%。这可以解释为:商业平台正在积极自动化商品描述、SEO文章和新闻流的制作,在这些领域,速度比独特性更重要。

对数据的关键说明

需要理解这一评估的局限性。我没有检查每个页面的创建历史,也没有询问作者。方法论依赖于概率性的语言标记,而非精确的归属。这里指的是完全由神经网络撰写或大幅编辑的内容。使用AI助手进行的小幅修改不在此类别中。

我的专家结论:我们看到的不仅仅是趋势,而是网络的根本性转型。市场已经适应了新的现实,即人类与机器创作之间的界限正在模糊。投资者和分析师应考虑到,搜索排名算法和变现系统将越来越积极地调整以过滤合成内容,这既带来风险,也为那些押注于可验证作者身份的项目创造了新的机遇。