人工智能产业正在抢购书籍和面孔:为什么机器仍然需要人类

人工智能行业面临一个意想不到的悖论:模型在合成数据上训练得越多,“有机”来源就越有价值。这里说的不仅是文本,还包括人脸、声音甚至动作。市场上正在形成新的、有时令人震惊的模式——从大规模收购书籍到为AI剧集租赁外貌。
模型崩溃:当AI吞噬自身
关键问题在于所谓的“模型崩溃”。当神经网络在另一神经网络生成的数据上训练时,它会退化:回答变得平庸,与现实脱节。这一术语最早由伊利亚·舒迈洛夫领导的研究人员在2023年5月正式提出。他们用数学方法证明,定期混入合成数据会导致模型遗忘罕见事件并累积错误。
问题的规模有数据佐证。2025年4月,Ahrefs分析师检查了Google搜索中的90万个新页面——超过74%带有自动生成痕迹。据Epoch AI估计,互联网上适合训练的文本可能在2026年至2032年间耗尽。正因如此,2022年前出版的书籍成为战略资源——它们保证“纯净”,不含机器垃圾。
ISBNdb模式:数百万本书籍扫描下架
拥有1.13亿种出版物元数据的ISBNdb服务向AI公司提供批量采购书籍的服务,单批可达百万册。模式很简单:书籍在二手市场被收购、扫描并销毁。调查报道发布后,该公司匆忙删除了推广页面,声称这只是一次“市场需求测试”。然而,独立旧书商证实,自2026年4月以来采购量异常增长:一位商人的周销量从20本跃升至数百本。
值得注意的是,买家对书籍的价值不感兴趣——只关心是否有ISBN。独特版本在扫描仪下永久消失。这笔交易的经济逻辑荒谬:一本2-5美元的书变成价值数十亿美元的模型。先例已经确立:2025年6月,法官威廉·阿尔苏普裁定,为AI训练对合法购买的书籍进行数字化属于合理使用原则范畴。只需保留收据即可。
面孔租赁:中国的新市场
类似的情况也出现在人类外貌领域。在中国,2026年第一季度发布的12.8万个AI迷你剧集中超过95%由AI制作,ActID和New Claw等平台向人们支付15至700美元以获取其面孔授权。用户可在专门工作室上传照片,制片人则挑选类型——从“邻家女孩”到“硬汉”角色。
这种模式并非出于自愿:传统剧集制作萎缩,广告预算下降,奢侈品牌转向AI内容。然而风险依然存在。北京律师伊勒·邓指出,授权条款往往模糊不清,无法弄清谁最终如何使用外貌。已有案例显示,出售的化身被用于政治宣传——例如与委内瑞拉马杜罗政权相关的假新闻。
接下来会怎样?
模式处处相同:过去数据被无偿获取,现在则为此付费。但本质不变——资产永久脱离所有者控制,只是现在多了一张收据。书籍、面孔、声音、动作——一切都变成训练模型的原料。市场刚刚形成,目前它有利于企业而非数据提供者。
我的结论:我们正在见证数据经济的根本性转变。AI行业为避免“模型崩溃”,正在创造一类新资产——“纯净”的人类数据。但若缺乏明确监管,这一市场可能沦为数字奴役,个人权利将被企业利益稀释。投资者应密切关注该领域的司法先例——它们将决定整个行业的未来。