发生了什么
近期,Hacker News 上一条讨论引发关注:一些 AI 公司在获取训练数据时,直接销毁了实体书籍。这一行为并非个例,而是随着大模型训练对高质量文本需求激增而出现的趋势。具体而言,部分公司购买稀有或绝版书籍后,为了扫描或翻拍,将书脊裁切甚至整本粉碎,以追求扫描效率和成本控制。这种做法导致大量实体书在数字化后即被物理销毁,其中不乏图书馆和收藏家难以寻得的珍本。
为什么重要
实体书不仅是知识的载体,更是文化和历史的见证。稀有书籍往往承载着独特的历史信息、版本差异和手写批注,其物理形态本身就是研究价值的一部分。AI 公司以“数字化”为名,却以“毁书”为代价,这暴露了数据获取过程中的短视和功利性。
更深层的问题在于,当 AI 训练数据成为稀缺资源,商业公司会优先考虑效率和成本,而非文化遗产的保护。如果这种趋势持续,大量未被数字化的稀有书籍将面临永久消失的风险。而现有的数字化项目(如 Google Books、Internet Archive)虽然覆盖面广,但仍有大量书籍未纳入,尤其是小语种、地方出版物和私人收藏。
影响与看点
这一事件对图书馆、档案馆和收藏家敲响了警钟:必须加速稀有书籍的数字化扫描,抢在 AI 公司“下手”之前完成备份。同时,它也引发了对 AI 数据获取伦理的讨论——训练数据的来源是否应该更加透明?是否应该建立更严格的法规,限制对不可再生文化资源的破坏?
对于 AI 行业而言,这不仅是公关危机,更是一个反思契机:高质量数据的获取不能以牺牲文化遗产为代价。未来,AI 公司或许需要与图书馆、博物馆建立更合作的关系,而非直接购买和销毁。
值得关注的是,社区中已有呼声要求建立“稀有书籍优先扫描”的协作网络,利用众包和开源工具加速数字化。这或许是一个可行的方向,但需要图书馆、技术社区和公众的共同努力。
独立判断:如果 AI 公司继续以“数据优先”的逻辑行事,而不考虑文化后果,那么它们不仅会失去公众信任,还可能面临更严格的监管。稀有书籍的扫描,不应是 AI 公司的“先斩后奏”,而应是全社会的共同行动。



