人工智能行业正在大量收购书籍和面孔:为什么机器仍然需要人类

当人工智能实验室报告模型训练进展时,一场围绕无法合成资源的竞赛正在幕后展开。这里说的是由人类创造的“纯净”数据。对这些数据的需求正呈现出越来越奇特的形式——从批量收购纸质书籍后将其销毁,到租用人类面孔用于数字虚拟形象。
拥有1.13亿种出版物元数据的ISBNdb服务,向AI公司提供了一项特殊服务:批量采购最多一百万册图书,随后进行数字化处理。当这一模式公之于众后,该公司匆忙删除了宣传页面,并声称这仅仅是“对市场需求的检验”。在平行的细分领域中,ActID和New Claw平台已经在向人们支付15至700美元,以获取将其面孔用作AI剧集角色基础的权利。
模型崩溃:当AI开始吞噬自身
被称为“模型崩溃”的现象,是指AI系统在基于其他神经网络生成的数据进行训练时发生的退化。每经过一个周期,结果就变得更加平庸,并失去与现实的联系。2023年5月,由伊利亚·舒迈洛夫领导的国际研究团队正式定义了这一术语,并从数学上证明,当掺入合成数据时,模型首先丧失再现罕见事件的能力,随后错误不断累积。
问题的规模显而易见。2025年4月,Ahrefs的研究人员检查了Google中90万个新索引页面——超过74%具有自动生成的迹象。据Epoch AI估计,互联网上所有适合训练的文字可能在2032年前耗尽。因此,2022年之前出版的书籍已成为黄金资产:它们保证不含合成垃圾和“有毒”数据。
特别值得一提的是2025年6月的司法先例,当时法官威廉·阿尔苏普裁定,对合法购买的纸质书籍进行数字化以训练语言模型,属于合理使用原则的范畴。这一裁决打开了闸门:现在只需保留纸质书籍的收据,即可在文件上证明数据的来源。
面孔作为商品:数字虚拟形象的新经济
中国的AI内容市场正呈现爆发式增长。2026年前三个月发布的12.8万部AI迷你剧中,超过95%是使用人工智能创作的。ActID和New Claw等平台已将外貌租赁转变为一项成熟的业务:图像授权费用从15美元到700美元不等,平台抽取10%的佣金。
然而,对数字克隆体使用的控制仍然脆弱。英国公民将虚拟形象权利出售给初创公司Synthesia的案例颇具代表性,他们的数字替身随后“出演”了支持委内瑞拉和布基纳法索独裁者的宣传视频。工会Equity已在推动立法,禁止转让不受控制的数字外貌权利。
各地的模式都一样:文本、面孔、声音、动作——一切都成为AI的原材料。过去数据被未经许可地获取,现在人们为此付费。但交易的本质没有改变:资产不可逆转地脱离所有者的控制,只不过现在多了一张收据。
我的评论:AI行业面临一个根本性悖论:模型在合成数据上训练得越多,退化得就越快,而“人类”数据就变得越珍贵。但这个数据市场是自发形成的,在法律上尚不成熟。在建立具有明确使用情境限制的透明许可体系之前,我们将不断看到关于个人数字副本失控的丑闻。这是一个系统性风险,而行业宁愿选择忽视它。