我的分析显示,亚马逊正在开展一项大规模印刷出版物数字化秘密行动,其规模甚至让见多识广的古旧书商都感到震惊。这不仅仅是扫描——书籍在处理后被物理销毁。这是一种系统性方法,揭示了科技巨头对用于训练神经网络的独特数据的渴望。
计划如何被揭露
一切始于稀有书籍卖家收到的异常订单。匿名买家大量购入了不同年代和主题的数百种出版物,包括独特版本。7月,一家古旧书店通过Biblio平台收到了一份一千本书的订单。卖家怀疑其中有蹊跷,同意追踪这批书的去向,在一卷书中藏了一个Apple AirTag GPS追踪器。
该设备将追踪引向了位于北拉斯维加斯的亚马逊设施。那里设有VGT3部门,经查,该部门负责处理印刷书籍。通过研究员工的公开信息和与前员工的交流,我还原了事件的全貌。
知识销毁流水线
过程如下。首先,员工登记每本出版物并扫描条形码或ISBN。然后是最野蛮的一步:将书籍的装订线切掉,使其变成一叠叠单独的纸张。这些纸张被送入高速扫描仪。这种方法最大限度地加快了数字化速度,但使物理书籍的恢复变得不可能。
据员工称,扫描是VGT3的主要功能。也有间接证据表明其规模之大:2026年初,该平台甚至出现了供应中断——对新一批待处理书籍的需求如此之大。
官方立场与现实
亚马逊在评论此事时确认,通过商业渠道采购印刷出版物。该公司表示,这些书籍用于“开发和改进产品与服务”。然而,该公司对采购规模、项目时间表以及准备数据的具体产品讳莫如深。
这种沉默比任何言语都更有说服力。显然,亚马逊正在构建自己的训练数据池,偏好物理档案而非数字档案——这可能是由于版权问题和现有数据集的质量问题。
我的结论:我们正在目睹人工智能行业的一场新军备竞赛。购买并销毁稀有书籍不仅仅是获取文本的一种方式,更是为训练创建独家内容的战略举措。当监管机构争论数字盗版问题时,企业正在采用更为激进的数据收集方法,这些方法游离于法律框架之外。问题只在于公众何时会意识到我们为算法进步所付出的代价。