当科技公司为训练AI而大规模扫描图书时,那些未被选中的实体书去了哪里?最近,一位书商的调查给出了令人不安的答案:它们可能被直接销毁。

发生了什么

据Ars Technica报道,一位书商在寄给亚马逊的几本绝版书中悄悄放置了苹果AirTag追踪器。这些书原本可能被用于亚马逊的AI训练项目——该团队甚至以一只准备吞噬书籍的霸王龙作为标志。然而,追踪结果显示,这些书最终被送往处理设施,作为废品销毁,而非被扫描或入库。

书商发现,亚马逊的AI团队在筛选书籍时,会丢弃那些被认为“不适合”训练的书,而销毁过程似乎没有经过任何二次检查或再利用流程。

为什么重要

这一事件折射出AI训练数据采集中的深层问题。首先,资源浪费令人震惊:绝版书往往具有稀缺性,甚至可能是孤本,而它们被当作废纸处理,不仅是对文化资产的破坏,也暴露了科技巨头在数据采集中的粗放态度。

其次,这引发了关于版权与合理使用的争议。亚马逊等公司从出版商或书商处获取图书用于AI训练,但那些未被选中的书,其版权归属和处置方式并未得到明确规范。书商是否知情?作者是否同意?这些都没有透明化的流程。

更关键的是,这一事件揭示了AI训练数据筛选的“黑箱”操作:什么书被选中,什么书被丢弃,标准是什么?公众不得而知。这种不透明性加剧了外界对AI公司数据实践的担忧。

影响与看点

对于书商和作者而言,这一事件敲响了警钟:在与科技公司合作时,必须明确约定书籍的用途和处置方式,否则可能面临文化资产的无谓损失。

对于AI行业,这起事件可能促使更多公司重新审视其数据采集流程,考虑更可持续、更尊重版权的做法。例如,是否可以将未选中的书籍捐赠给图书馆或转售,而非直接销毁?

此外,AirTag追踪器的使用也展示了民间监督科技巨头行为的新方式。在缺乏监管的情况下,这种“技术对抗”或许能倒逼企业提高透明度。

但我们也应看到,AI训练需要海量数据,而图书是高质量文本的重要来源。如何在数据需求与资源保护之间取得平衡,是整个行业面临的长期挑战。亚马逊的这次事件,或许只是冰山一角。