METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

亚马逊被曝存在粉碎扫描稀有图书的工厂,靠AirTag追踪暴露

404 Media在图书箱中放入定位追踪器进行追踪,发现书籍在拉斯维加斯仓库被切割书脊后用于Nova模型训练

亚马逊被曝存在粉碎扫描稀有图书的工厂,靠AirTag追踪暴露

图片:METAL

摘要

  • 404 Media在稀有图书箱中放入苹果AirTag进行追踪,结果发现包裹送到了拉斯维加斯亚马逊仓库的"VGT3"团队
  • 仓库工人为提高扫描速度会切掉书脊,原书在此过程中被销毁,亚马逊将这些数据用于训练自家的Nova模型
  • Anthropic此前也被曝以"Panama项目"为名进行过类似的图书采购、切割、扫描作业,该事实在版权诉讼中被披露,法院以原书被销毁为由认定其构成合理使用

悄悄放进图书箱的定位追踪器

404 Media在一箱稀有图书中藏入了一枚苹果AirTag,并全程追踪了这批货物的运送路线。包裹最终送达的地点,是位于拉斯维加斯的一座亚马逊仓库。据404 Media的调查报道披露,负责该仓库图书扫描工作的团队名为VGT3,团队标志上画着一只嘴里叼着书的霸王龙。

切掉书脊以提高扫描速度

据仓库工人陈述,为了提高扫描速度,他们会把书的书脊切掉。相比一页一页翻扫,把书脊切断、拆成散页后再上机扫描要快得多。问题在于,这个过程会对原书造成事实上不可逆的损毁。亚马逊将这样获取的文本数据用于训练自家大语言模型(LLM)Nova。该公司发言人仅回应称,他们通过商业流通渠道购买图书用于产品改进,但并未就切割、销毁书籍这一做法本身作出回应。

为何盯上纸质书——ISBN全面扫荡疑云

图书行业人士怀疑,AI公司正在按ISBN编号逐一扫荡几乎所有存世图书。纸质书之所以格外珍贵,原因有二:一是许多书籍从未以文本形式上线;二是2022年之前出版的书籍成书于生成式AI普及之前。业内普遍担忧的是,ChatGPT问世后涌入网络的海量文本中混杂了大量AI生成的内容,作为训练数据的可信度大打折扣,而纸质书恰恰不受这种污染影响。

Anthropic也走过同一条路——Panama项目

这种做法并非亚马逊独有。在图书作者提起的版权诉讼过程中,Anthropic也被曝进行过类似操作,内部代号为"Panama项目"(Project Panama)。Anthropic从二手市场大量购入图书,采用切掉书脊后数字化的方式处理。负责该诉讼的法官裁定,这种扫描作业属于合理使用(fair use),不构成侵权。判决依据之一是:由于原版实体书被销毁,不存在被重新复制或转卖的情况。

项目亚马逊Anthropic
内部代号(未公开,团队名为VGT3)Panama项目
方式购书后切割书脊再扫描购书后切割书脊再扫描
训练目的自家模型Nova语言模型训练数据
暴露途径404 Media的AirTag追踪作者版权诉讼
法律结论尚未有定论以原书被销毁为由认定合理使用

编辑视角

这起事件所处的背景十分清晰:业界普遍认为,网络上干净可用的文本正在枯竭。2022年之前出版的书籍是经过验证的"纯净数据"——没有一句话出自生成式AI之手。一旦企业判断这种价值远超购书销毁的成本,它们建造的就不再是图书馆,而是仓库。VGT3团队标志上特意画上叼着书的恐龙,也说明这项工作在组织内部已经是一项被公开承认的常规业务。

过去提到数据采集,人们首先想到的是网络爬取或授权协议。如今这幅图景已经变成了在物流仓库里用手工切割书脊。这一转变之所以引人注目,是因为这是AI公司从"数字"伸向"模拟"的逆向操作。值得关注的是,Anthropic获得的法院判决为这一趋势提供了某种正当性——只要销毁原件、不再转卖流入市场,就不构成版权侵权,这一逻辑将进一步激励其他AI公司效仿同样的做法。

国内企业能从中汲取的实务教训有两点:其一,训练数据是否"受到污染"正在成为决定模型质量的重要变量;其二,在与他人签订将版权内容用于AI训练的合同时,"销毁原件"条款有可能成为一道法律防线。对于拥有出版社、图书馆、档案馆资源的机构而言,需要意识到,在这股潮流中,自己手中的纸质资产所拥有的谈判筹码,可能比想象中更大。

未来几周内,其他大型科技公司的类似案例很可能被陆续曝光。既然已有两家公司牵涉其中,如果后续没有人去追踪谷歌或Meta的物流网络,那反倒会显得不同寻常。

评论