加密新闻

08.08.2026
03:30

人工智能产业正在大量购买书籍和面孔:为什么机器仍然需要人类

img-bbaf321c89b70f44-1766402574726061

拥有1.13亿种出版物元数据的服务商ISBNdb,向人工智能实验室提供了一项非同寻常的服务:批量采购图书,每批最多可达一百万册,随后进行数字化处理并销毁。在该方案被记者曝光后,该公司匆忙删除了宣传页面,并声称未达成任何交易,称这只是“对市场需求的检验”。

与此同时,行业内另一个趋势正在兴起:ActID和New Claw等平台向人们支付15至700美元,以获取在AI剧集和广告中使用其肖像的权利。让我们来探讨一下,为什么神经网络迫切需要“人类”内容,以及什么是模型崩溃。

递归的诅咒

“模型崩溃”一词描述的是人工智能系统在基于其他神经网络生成的数据进行训练时出现的退化现象。每经过一个循环,结果就变得更加平均化和可预测,逐渐失去与现实的联系。2023年5月,由伊利亚·舒迈洛夫领导的国际研究团队首次将这一现象系统化,发表了题为《递归的诅咒》的论文。

问题的严重程度有数据为证:2025年4月,Ahrefs的分析师检查了谷歌搜索中的90万个新页面,发现超过74%的内容带有自动生成的痕迹。据Epoch AI估计,互联网上所有适合训练的文字内容可能在2026至2032年间耗尽。正因如此,2022年之前出版的书籍成为AI公司的金矿——这是少数几个保证不含“合成垃圾”的来源之一。

书籍被销毁

收购并销毁印刷出版物的做法已不仅限于个别初创公司。2024年8月,三位美国作家对Anthropic提起集体诉讼,指控该公司侵犯版权。调查发现,该公司向“非官方”项目Panama投入了数千万美元:批量购买印量,用液压刀切割书脊,并以工业规模扫描书籍。2025年6月,法官威廉·阿尔苏普裁定,此类数字化符合合理使用原则。

ISBNdb作为运营了二十多年的最大元数据库,向AI实验室提供了批发经纪服务:批量收购1000至100万册图书,保证“纯净”无AI垃圾,并通过保密协议提供法律保护。该平台管理层曾直言:“AI公司销毁了两百万本书——这不是一个能赢得公众同情的标题。”二手书商证实,自2026年4月起出现了异常采购——一位商人的销量从每周二十本增长到数百本。

原材料与成品之间的价值差距令人震惊:一本扫描后立即销毁的书在二手市场上价值2至5美元,而基于数百万册此类书籍训练出的模型估值则高达数十亿美元。

面部租赁

在中国,AI内容市场增长迅猛:2026年前三个月发布的12.8万部AI迷你剧中,超过95%是使用人工智能创作的。ActID和New Claw等平台采用市场模式运营:公司向人们支付15至700美元以获得其肖像的授权。用户上传在专门工作室拍摄的照片,制片人则按“邻家女孩”或“硬汉”等类别挑选面孔。

然而,对自己外貌的控制权是脆弱的。将数字头像权利出售给初创公司Synthesia的英国公民发现,自己的面孔出现在与尼古拉斯·马杜罗政府和布基纳法索独裁者易卜拉欣·特拉奥雷相关的宣传视频中。北京律师伊勒·邓指出:授权条款往往模糊不清,无法确定最终谁将如何使用这些外貌。

别忘了收据

模式处处相同:文本、面孔、声音、动作——一切都成为AI的原材料。过去数据是被未经许可地获取,现在则要付费。但交易结构没有改变:资产不可逆转地脱离所有者的控制,只是现在多了一张收据。

我的结论:我们正在见证一类新资产——“人类数据”——的形成,其价值不取决于内容本身,而取决于是否适合训练。只要AI行业依赖“有机”内容,这种依赖就会不断加深。但一旦模型学会在无崩溃的情况下自我生成高质量数据,人类贡献的价值可能会迅速归零。问题只在于,法律框架能否在我们最终失去对自身数字本质的控制之前及时适应。