人工智能产业正在大量收购书籍和面孔:为什么神经网络需要“有机数据”,这又意味着什么

人工智能行业面临一个悖论:模型越多地基于其他神经网络生成的数据进行训练,它们退化得就越快。这一现象被称为“模型崩溃”,迫使各实验室寻找越来越精巧的方法来获取“纯净”的人类数据。如果说过去还只是抓取网站,那么现在已发展到收购印刷书籍……以及租赁人脸。
递归的诅咒
“模型崩溃”这一术语由伊利亚·舒迈洛夫领导的国际研究团队正式提出。在他们引起广泛反响的论文《递归的诅咒》中,他们从数学上证明了:当神经网络基于另一个神经网络生成的数据进行训练时,它会丧失正确再现稀有事件和细微规律的能力。每一轮循环都会让模型变得更加平庸和可预测,而错误也在不断累积。
问题的规模有数据为证。根据我对网络分析数据的分析,目前互联网上已有超过74%的新内容带有自动生成的痕迹。而据Epoch AI估计,网络上所有适合训练的文字内容可能在2026至2032年间耗尽。正因如此,2022年之前出版的书籍已成为战略性资源——这是少数几个保证不含“合成垃圾”的来源之一。
华氏451度之Anthropic版
在此背景下,整合了1.13亿种出版物元数据的ISBNdb服务向AI公司提供了一项特殊服务:批量采购图书,单次可达一百万册,随后进行数字化处理并销毁,也就不足为奇了。当媒体曝光这一模式后,该公司急忙删除了相关介绍页面,并声称并未达成任何交易,只是“测试市场需求”而已。
然而,独立旧书商证实:自2026年4月以来,出现了异常的大规模采购。一位书商的销量从每周二十本飙升至数百本。采购方不关心体裁或价值——关键是必须有ISBN编号。而珍稀版本则因此永久流失:仅存的孤本可能最终葬身于扫描仪之下。
值得注意的是,法院已经开始将这种做法合法化。2025年6月,法官威廉·阿尔苏普裁定,对合法购买的印刷书籍进行数字化以训练语言模型,属于合理使用原则的范畴。现在只需保留收据——数据的来源就可以得到文件证明。
需要更多
与此同时,市场上正在形成一个新的细分领域——人脸租赁。ActID和New Claw等平台向人们支付15至700美元不等的费用,以获得将其面孔用作AI剧集和广告角色基础的权利。2026年前三个月,中国128,000部AI迷你剧中超过95%是使用人工智能制作的,这催生了对“鲜活”可辨识面孔的巨大需求。
然而,这种控制被证明是脆弱的。出售了自己面孔许可的人后来发现,他们的数字克隆被用于不道德的广告甚至政治宣传。两起涉及英国公民的轰动案件——他们将头像权利出售给了初创公司Synthesia——表明:他们的形象被用于委内瑞拉的假新闻和布基纳法索的宣传。
别忘了收据
书籍和面孔并非AI公司所需的全部。机器人还需要人类自然动作的范例。特斯拉向穿着动作捕捉服重复日常动作以训练Optimus机器人的工作人员支付高达每小时48美元的费用。2025年,人形机器人研发领域的投资超过60亿美元。
模式处处相同:过去数据是被无偿获取的,现在则要付费。但交易结构并未改变——资产永久性地脱离所有者的控制,只是现在多了一张收据。
我的结论:“人类数据”市场正变得像石油或天然气一样具有原材料属性。但与碳氢化合物不同的是,失去对自己面孔、声音或文本的控制,会对个人身份造成不可逆转的后果。图书收购的合法化开创了一个危险的先例:如果为了数据可以销毁实体载体,那么又有什么能阻止将这种逻辑扩展到人类身份的其他方面呢?