亚马逊被曝为获取AI训练数据,大量购买印刷书籍并扫描后销毁,甚至包括珍稀版本。这一行为通过一枚AirTag的追踪记录被公之于众。

发生了什么

据报道,一位用户将AirTag藏在寄给亚马逊的书中,以追踪其去向。追踪记录显示,书籍被送往亚马逊的扫描设施,随后被送往销毁中心。整个过程表明,亚马逊系统地扫描书籍内容,用于训练AI模型,而实体书则被处理掉。

为什么重要

这一事件揭示了AI训练数据获取的灰色地带。亚马逊作为大型科技公司,需要海量高质量文本数据来训练大语言模型。购买实体书并扫描,虽然可能符合某种法律解释,但涉及版权问题,尤其是珍稀书籍的销毁,引发了资源浪费和文化遗产保护的担忧。此前,谷歌图书案曾引发类似争议,但亚马逊的做法更为激进,直接销毁实体书。

影响与看点

对出版商和作者而言,这一行为可能加剧对AI训练数据使用的法律挑战。对开发者来说,AI模型的训练数据来源将越来越受关注,透明度和合规性成为关键。对用户而言,这一事件提醒我们,AI的发展可能以牺牲实体文化资源为代价。值得关注的是,亚马逊是否会调整其数据采集策略,以及相关法律是否会进一步收紧。独立判断:在AI竞赛中,数据获取的伦理边界正在被不断试探,行业需要更明确的规则。