人工智能产业正在大量购买书籍和面孔:为什么机器仍然需要人类

聚合了1.13亿册印刷出版物元数据的服务商ISBNdb,向AI实验室提供了一项非同寻常的服务:批量采购图书,单批最高可达一百万册,随后进行数字化处理并销毁。在该方案被媒体曝光后,该公司匆忙删除了相关介绍页面,并声称这仅仅是“测试市场需求”,并未达成任何交易。
与此同时,在另一细分领域,ActID和New Claw等平台向人们提供15至700美元不等的报酬,以获取其面部肖像的授权,用于AI角色在剧集和广告中的呈现。让我们来探究一下,为什么实验室被迫追逐“有机数据”,以及机器还需要哪些来自人类的东西。
合成数据的诅咒
“模型崩溃”一词描述的是AI系统在基于其他神经网络生成的数据进行训练时出现的退化现象。每经过一个循环,结果就变得更加平庸、可预测,并逐渐失去LLM本应反映的现实关联性。2023年5月,由伊利亚·舒迈洛夫领导的国际研究团队在《自然》杂志上发表了题为《递归的诅咒》的论文,首次将这一现象形式化。他们通过数学方式证明:如果定期掺入合成数据,模型首先会遗忘罕见事件和细微规律,随后错误不断累积,回答的多样性也会降低。
问题的严重程度有数据为证。2025年4月,Ahrefs的分析师检查了谷歌搜索中的90万个新页面,发现超过74%的内容具有自动生成的痕迹。据Epoch AI估计,互联网上所有适合训练的文字内容可能在2026至2032年间耗尽。2022年之前出版的书籍,成为AI公司为数不多的、可以保证不含合成垃圾和内置陷阱的数据源之一。一些作者甚至采用“投毒”手段,在文本中隐藏指令。英国AI安全研究所、Anthropic和牛津大学的研究表明:仅需250份“被投毒”的文档,就能在不知不觉中让LLM学会有害模式。
书籍被销毁
2024年8月,三位美国作家对Anthropic提起集体诉讼,指控该公司在训练Claude模型时侵犯版权。根据案件材料,Anthropic向“Panama”项目投入了数千万美元:匿名购买印刷书籍的印量,切掉书脊,进行工业化规模扫描,然后销毁。2025年6月,法官威廉·阿尔苏普裁定,对合法购买的书籍进行数字化以训练语言模型,属于合理使用原则的范畴。现在只需保留收据——数据的来源就有了文件证明。
这种做法已不仅限于个别初创公司。作为二十多年来最大的印刷书籍元数据数据库,ISBNdb已将批量收购并销毁书籍变成了一项交钥匙服务。2026年7月21日,记者伊曼纽尔·迈伯格在该公司网站上发现了一个促销板块,面向AI实验室提供以下服务:
- 收购2022年之前出版的书籍,批量从1000册到100万册不等;
- 保证数据“纯净”,不含AI垃圾内容和投毒算法;
- 通过保密协议提供法律保护,并确保二手市场采购的合法性。
该平台管理层直言不讳:“认知问题确实存在。‘AI公司销毁了两百万本书’——这样的标题可不会赢得公众好感。”对独立旧书商的调查证实,自2026年4月起出现了异常采购:一位书商的销量从每周二十册飙升至数百册。买家对类型和价值一概不感兴趣——只要有ISBN就行。珍稀版本因此被永久流失,被送去扫描而不是摆上书架。
调查报道发布后,ISBNdb删除了促销页面并发表声明,否认达成任何交易。然而,原材料与成品之间的价值差距不言自明:一本在二手市场价值2至5美元的书,变成了估值数十亿美元的模型。
人脸成为商品
在中国,过去三年法院审理了约700起利用AI非法使用他人肖像的案件。2026年3月,北京一家法院作出了前所未有的裁决:未经许可在深度伪造中使用他人面部属于违法行为,即使图像经过修改。这反映了AI内容的繁荣:2026年前三个月发布的12.8万部AI微短剧中,超过95%是由人工智能生成的。ActID和New Claw等平台采用市场模式运作:公司向人们支付15至700美元以获得图像授权,用户则在专门的工作室自行上传照片。类别从“邻家女孩”到“硬汉”和“超模”一应俱全。
其宣称的目标是保护人们免受字节跳动旗下“红果”平台所遭遇的情况——当时两位网红指控该公司盗用其面孔,一部拥有4000万观看量的剧集被迫下架。自2026年初以来,字节跳动已删除超过8.5万个未经授权使用他人面孔和声音的视频。然而,管控仍然脆弱。英国公民将肖像权出售给初创公司Synthesia后,发现他们的数字替身被用于支持委内瑞拉和布基纳法索独裁者的宣传视频中。演员工会Equity现在正推动立法,禁止转让不受控制的数字肖像权。
不仅仅是书籍和面孔
机器人需要自然动作的示例。当前的物理模拟并不完美,机器人的合成数据也面临同样的崩溃问题。2025年,人形机器人研发领域投入超过60亿美元,Scale AI和Encord等公司雇佣操作员记录日常动作。特斯拉为穿着动作捕捉服重复日常动作以训练Optimus的人员支付高达每小时48美元的报酬。
抛开载体差异——文本、面孔、声音、动作——模式都是一样的。过去,数据是未经许可获取的:扫描档案、抓取照片、利用公开语音进行训练。现在,这些都需要付费。但交易结构并未改变:资产永久脱离所有者的控制,只不过现在多了一张收据。
我的评论:我们正在见证一个根本性的转变:AI行业从寄生式数据消费转向合法但同样掠夺性的数据采购。在市场形成对授权资产使用的长期管控机制之前,所有者——无论是作者还是模特——都受制于同一笔交易:一次性付款,换取永久失去控制权。