加密新闻

08.08.2026
00:15

人工智能产业正在大量收购书籍和面孔:为什么神经网络迫切需要“人类”原材料

img-bbaf321c89b70f44-1766402574726061

人工智能培训市场正在经历一场翻天覆地的变革。各大实验室和初创公司面临优质数据短缺,开始争抢“有机”原材料——书籍、面孔和声音。这不仅仅是授权许可的问题,而是大规模收购和销毁印刷出版物的行动。这场对纯净内容的争夺,是被称为“模型崩溃”现象的直接后果。

递归的诅咒

“模型崩溃”一词描述的是神经网络在基于其他人工智能生成的数据进行训练时出现的退化现象。每一轮循环都会让模型变得更加平庸,与现实脱节。2023年5月,伊利亚·舒迈洛夫领导的研究团队首次将这一现象正式化,发表了题为《递归的诅咒》的论文。他们用数学方法证明,掺入合成数据会导致稀有知识的丢失和错误的累积。

这个问题已不再是理论性的。根据我基于网络分析数据的估计,互联网上超过74%的新内容是由自动化生成的。同时,根据Epoch AI的计算,适合训练的“纯净”文本储备可能在2026年至2032年间耗尽。正因如此,2022年之前出版的书籍成为战略资源——这些书中几乎可以保证既没有合成垃圾,也没有作者为“投毒”数据而故意嵌入的“陷阱”。

书籍的衔尾蛇

拥有1.13亿种出版物元数据的ISBNdb服务,向人工智能公司提供了一项特殊服务:批量采购书籍,最多可达一百万册,随后进行数字化和销毁。当媒体曝光这一模式后,该公司急忙删除了相关描述页面,并声称未达成任何交易,称这只是“对市场需求的测试”。然而,独立二手书商证实,自2026年4月以来出现了异常的采购激增。买家不关心书籍的体裁或价值——只关心是否有ISBN编号。这让我想起Anthropic的先例,该公司在“巴拿马项目”中匿名收购印刷批次,裁掉书脊并进行扫描。2025年6月,法官威廉·阿尔苏普裁定,对合法购买的书籍进行数字化属于合理使用原则的范畴。现在,只要保留收据——数据的来源就得到了合法确认。

这门生意的经济逻辑荒谬至极:一本二手书在市场上价值2至5美元,而基于数百万册此类书籍训练的模型,估值却高达数十亿美元。

面孔的租赁

在市场的另一个细分领域,像ActID和New Claw这样的平台向人们支付15至700美元,以使用他们的面孔作为人工智能剧集角色的基础。需求巨大:2026年第一季度中国发布的128,000部人工智能迷你剧中,超过95%是由神经网络创作的。然而,对生物识别数据的控制是虚幻的。已有先例表明,英国演员出售给Synthesia的数字克隆被用于支持独裁政权的宣传视频中。北京律师伊莱·邓正确地指出:许可条款模糊不清,无法弄清楚最终是谁、以何种方式在使用你的外貌。

我的结论

我们正在见证一种新数据经济的形成,其中人类经验变成了大宗商品。目前市场正从窃取转向付费,但交易结构仍然是掠夺性的:资产不可逆转地脱离了所有者的控制,只是现在多了一张收据。这是一个危险的趋势,需要严格的监管,否则我们不仅可能失去对自己数据的控制,还可能失去使人工智能真正有用的信息多样性本身。