一边在内部邮件里把AI数据抓取定性为“人类历史上最大规模的劳动力窃取”,一边继续抓取付费墙后的新闻内容——新解封的法庭文件,把微软与OpenAI之间这层公开场合不会说的默契摆上了台面。

发生了什么

据TechCrunch报道,一批此前被涂黑、如今解封的法庭文件显示,微软高层在内部沟通中,用极为严厉的措辞描述OpenAI的数据获取方式,将其称为“the largest theft of labor in human history”(人类历史上最大规模的劳动力窃取)。

与此同时,文件还显示两家公司在实际操作层面并未因此收手:它们抓取了《纽约时报》等媒体的付费墙内容,用这些材料构建训练数据集,并在内部预警称,这种做法会“掏空”出版商的内容生意。也就是说,对风险的认知与对行为的继续,是同时存在的。

这些文件来自围绕AI训练数据合法性的诉讼,此前大量关键段落被涂黑,这次解封让外界第一次看到科技巨头在内部如何评估自己行为的性质。

为什么重要

这组文件的价值不在于“又一起版权纠纷”,而在于它揭示了行业内部真实的认知落差。

长期以来,AI公司对外的标准说法是:训练数据来自公开可获取的网络内容,属于合理使用范畴。但内部措辞完全是另一套语言——用“盗窃”而非“使用”,用“掏空”而非“影响”。这种内外表述的割裂,恰恰是版权诉讼中最致命的证据类型:它说明企业自己清楚行为可能造成的损害,却仍选择推进。

更微妙的是,这番话出自微软而非OpenAI。微软既是OpenAI最大的投资方和云服务提供方,也是把相关模型能力打包进自家产品的一方。它一边在商业上深度绑定,一边在内部对数据来源表达道德和法律层面的疑虑,这种“既参与又切割”的姿态,未来很可能在责任划分上成为争议焦点。

影响与看点

对内容出版商而言,这批文件强化了它们在诉讼中的论证链条:损害不是抽象的,而是被合作方自己预判并记录在案的。这可能推动更多媒体跟进索赔,也会让“授权数据”这件事从道德呼吁变成有法律压力的商业选项。

对AI开发者和使用API的团队来说,短期直接影响有限,但中期值得警惕:如果训练数据的来源合法性被更严格地追溯,模型供应商可能被迫调整数据策略,进而影响模型能力边界、定价,甚至某些功能的可用性。依赖单一供应商的团队,应该把“数据来源合规性”纳入供应商评估清单。

对普通用户,这件事的落点更朴素:你每天读到的新闻、写下的评论、上传的图片,正在以何种方式、以什么价格被用于训练模型,仍然缺乏透明机制。

一个独立判断:这轮诉讼真正要裁决的,或许不是某家公司有没有“偷”,而是当整个行业都建立在同一套未经授权的数据之上时,法律该如何定义“合理使用”的边界——而这个答案,会决定下一代AI产品的成本结构。