加密新闻

24.08.2026
05:25

人工智能席卷网络:超过三分之一的新网页由神经网络生成

AI fake news фейки

生成式模型在互联网空间中的渗透规模远比人们普遍认为的更为严重。我对最新数据的分析显示:互联网上所有现有网页中约有10%带有明显的合成文本痕迹。然而,如果仅考虑2022年11月ChatGPT首次亮相后发布的内容,情况就变得真正令人担忧——此类材料的占比超过三分之一。

方法论:如何区分人类与机器

该研究基于2026年7月通过Common Crawl存档收集的10,000个英语页面的随机样本。识别过程中使用了一种机器学习模型,用于检测文本中生成式算法特有的语言模式。需要明确的是:这不是精确统计,而是对作者身份的概率性评估。

乍一看,10%可能显得微不足道。但样本包含了大量在当代大语言模型时代之前很久创建的过时内容。当我剔除“史前”页面并聚焦于2022年后的材料时,合成内容的占比飙升至34-36%。这直接证明了ChatGPT、Claude、Gemini及其竞争对手正在以多快的速度改变信息领域。

商业领域——主要受影响区域

AI内容在不同域名区域中的分布极不均衡,这很能说明问题。在.com区域中,约有十分之一的页面检测到生成痕迹——是.org区域(4.6%)的两倍。而在学术(.edu)和政府(.gov)领域,合成内容的占比仅勉强达到1%。

这种失衡是可以解释的。商业平台历来以大规模文本生产为导向:商品描述、SEO文章、新闻推送。这些格式最容易实现自动化。编辑部和企业博客积极利用AI来降低内容生产成本,以牺牲质量和独特性为代价换取数量。

保留意见与现实风险

需要强调的是:该研究并非声称每一篇此类文本都是由神经网络从零开始撰写的。这里指的是“由AI撰写或大幅编辑”的内容。诸如语法修正之类的小改动不在此列。尽管如此,趋势是显而易见的:互联网正迅速被合成内容填满,而且这一进程正在加速。

在此背景下,Anthropic对Claude内容进行全球标记的举措看似及时,但仍显不足。文本来源的透明度对于维护对信息的信任变得至关重要。如果没有明确的标准和验证机制,我们可能会淹没在看似合理却缺乏灵魂的生成内容洪流中,这些内容模糊了真实经验与统计概率之间的界限。

我的专家意见是:市场迫切需要协议层面的内容认证工具,而非个别公司的自愿倡议。否则几年后,我们将无法区分分析与模型幻觉,这将打击整个数字媒体生态系统。