人工智能产业正在抢购书籍和面孔:为什么神经网络需要“有机数据”,以及接下来会发生什么

整合了1.13亿种出版物元数据的ISBNdb服务,向AI公司提供了一项特殊服务:批量采购图书,最多可达一百万册,随后进行数字化处理并销毁。当这一模式公之于众后,该公司急忙删除了服务介绍页面,并声称未达成任何交易,称这只是“市场需求的测试”。
在市场的另一细分领域,ActID和New Claw平台愿意向人们支付15至700美元,以获得将其面部作为AI剧集和广告角色基础的权利。
让我们来分析一下,为什么实验室被迫购买“有机数据”,什么是“模型崩溃”,以及机器还需要哪些人力资源。
衔尾蛇:当AI吞噬自身
“模型崩溃”一词描述的是AI系统在基于其他神经网络生成的数据进行训练时性能退化的现象。每经过一个周期,结果变得更加平均化、可预测,并失去与大型语言模型本应反映的现实之间的联系。
这一术语最早由伊利亚·舒迈洛夫领导的国际研究团队正式提出。2023年5月,他们发表了引起广泛关注的研究《递归的诅咒:在生成数据上训练导致模型遗忘》,从数学上证明:如果定期混入合成数据,模型将无法正确再现稀有事件的信息,随后开始积累错误。
问题的规模有数据为证。2025年4月,Ahrefs的研究人员检查了Google搜索中90万个新编入索引的页面——带有自动生成特征的资料占比超过74%。根据Epoch AI的估计,互联网上所有适合训练的文本可能在2026年至2032年间耗尽。
正因如此,2022年之前出版的书籍具有特殊价值——它们是少数几个保证不含机器垃圾和故意“陷阱”的来源之一。一些作者已经采取了反制措施——“投毒”数据,在文本中隐藏模型会解读为隐藏命令的字符。英国AI安全研究所、Anthropic和牛津大学的联合团队研究表明:仅需250份“投毒”文档,就能悄无声息地让LLM学习有害模式。
华氏451度之Anthropic
在这场竞赛中,书籍的命运并非所有卖家都看得清楚。2024年8月,三位知名美国作家对Anthropic提起集体诉讼,指控其管理层在训练Claude模型时侵犯版权。根据案件材料,该公司向“非官方”项目Panama投入了数千万美元:匿名收购印刷书籍的整批印量,切掉书脊,进行工业化规模扫描,随后销毁。
2025年6月,法官威廉·阿尔苏普裁定:对合法购买的印刷书籍进行数字化处理,并使用数字副本训练语言模型,属于合理使用原则的范畴。现在只需购买纸质书并保留收据——数据的来源就有了文件证明。
据404 Media报道,这种做法早已超出个别初创公司的范围。ISBNdb作为运营二十多年的最大国际印刷书籍元数据数据库,已将收购和销毁图书变成了一站式服务。2026年7月21日,记者伊曼纽尔·迈伯格发现了一个推广板块,该公司在此向AI实验室提供批发经纪服务:
- 组织收购2022年之前的印刷书籍,批量从1000册到100万册不等;
- 保证书籍“纯净”,不含AI垃圾和投毒算法;
- 通过保密协议和二手市场收购的合法性提供法律保护。
平台管理层直言不讳:“认知问题确实存在。‘AI公司销毁了两百万本书’——这不是一个能赢得公众同情的标题。”
独立书商证实,自2026年4月起出现了异常采购:销量从每周二十册增长到数百册。采购方不关心体裁或价值——主要标准是ISBN代码。甚至购买了稀有外文版本,无视其价格。独一无二的版本将永久消失——唯一存世的副本可能在扫描仪下结束其生命。
调查发布后,ISBNdb删除了推广页面并发表声明:“事实是:ISBNdb从未购买、扫描或出售过书籍。该页面只是对市场需求的测试。”
原材料与成品之间的价值差距很难说是成比例的。扫描后立即销毁的书籍在二手市场上售价为2至5美元。而基于数百万册此类书籍训练的模型,估值可达数十亿美元。
需要更多:面孔和声音的市场
过去三年,广州互联网法院审理了约700起利用AI非法使用他人外貌的案件。2026年3月,北京法院作出了一项前所未有的裁决:未经许可在深度伪造中使用他人外貌属违法行为,即使图像已被修改。
这一实践反映了AI内容市场的增长。在中国,2026年前三个月发布的12.8万部AI短剧中,超过95%是使用人工智能制作的。对真人面孔的需求催生了一种新型交易——外貌租赁。ActID和New Claw平台像市场一样运作:公司支付15至700美元以获得图像授权。用户在专门的工作室上传照片,制片人按性别、年龄以及“邻家女孩”或“硬汉”等类别选择面孔。
New Claw运营部门负责人龙刘简单解释了逻辑:“出售照片使用权让人们有机会在继续线下职业的同时赚钱。”ActID于2026年3月在深圳成立,注册了约800名用户,其中300人同意授权图像。每集价格从15美元到74美元不等,平台收取10%的佣金。
平台宣称的目标是保护人们免受ByteDance旗下AI短剧平台Hongguo所发生事件的影响。2026年4月,两名网红指控该公司盗用其面孔。这部拥有4000万观看量的剧集不得不下架。自2026年初以来,ByteDance已删除了超过8.5万个未经授权使用他人面孔和声音的视频。
北京律师伊勒·邓认为授权市场是积极的一步,但他警告:“许多机构只付给人们几十美元来收集数据。授权条款往往模糊不清,无法确定最终是谁、出于什么目的在使用这张面孔。”
在实践中,控制被证明是脆弱的。出售面孔授权的人发现,他们的数字克隆被用于不诚实的广告或政治宣传。两个引起广泛关注的案例涉及英国人,他们将虚拟形象权利出售给了初创公司Synthesia:演员丹·杜赫斯特发现他的“克隆体”成为了与尼古拉斯·马杜罗政府有关联的假新闻频道主持人,而模特马克·托雷斯则发现他的形象被用于支持布基纳法索独裁者的宣传视频。这两个案例都成为英国演员工会Equity的先例,该工会正在推动立法禁止转让不受控制的数字外貌权利。
别忘了收据
书籍和面孔并不是AI公司需要的全部。语音数据市场也出现了类似情况:2026年6月,SAG-AFTRA工会成员批准了一项协议,扩大了对未经同意使用合成语音副本的保护。
机器人需要自然动作的示例。现代物理模拟无法足够精确地再现手如何握住杯子,因此机器人的合成数据面临与模型崩溃类似的问题。据MIT数据,2025年人形机器人开发投资超过60亿美元,而Tesla每小时支付高达48美元,让人们穿着动作捕捉服数小时重复日常动作来训练Optimus机器。
如果抛开载体差异——文本、面孔、声音、动作——模式到处都是一样的。以前数据是未经许可获取的:扫描档案、抓取照片。现在要为此付费。只是交易结构没有改变:资产同样不可逆转地脱离所有者的控制,只是现在多了一张收据。
书籍和人类外貌似乎是不同的类别,但对AI行业来说,它们是同一类型的资源——训练数据。公司愿意购买,但市场的结构决定了交易不提供保护。权利转移后,人们无法完全控制谁将如何使用他们的声音、面孔或生成的内容。
我的结论:我们正在见证数据经济的根本性转变。AI行业在达到“免费”内容的天花板后,现在被迫为有机数据付费,但这样做缺乏透明的权利保护机制。在法院和工会追赶现实的同时,市场将继续是“狂野西部”,其中的问题不仅是金钱,还有对自身身份的控制权。