《纽约时报》诉 OpenAI 和微软的版权案,9 月 17 日多了一份解封文件。这是时报方提交的一份法律简报,此前以删节版存档,这次放出了未删节内容,里面引了微软一名高管在 2024 年 1 月内部演示里的原话。
说这话的人是微软应用科学总监 Brent Hecht。按简报的引述,他把用新闻内容训练大模型形容为:
“an astonishing theft of unprecedented proportions” / “the largest theft of labor in human history”
一场规模空前、令人震惊的窃取,可能是人类历史上最大的劳动窃取。
简报还称,Hecht 提醒过 OpenAI 在排查系统中哪些内容来自时报等原告时,可能构成一次”意外的掩盖”(accidental cover up)。
简报列出的几组数字
时报方在简报里给出了几份数据集的构成,都是从案件取证材料里整理出来的:
- OpenAI 的一个中期训练数据集里,有超过 91692 份来自《纽约时报》、《每日新闻》和调查报道中心的作品副本;
- 一份由 Common Crawl 衍生的数据集,含有超过 200 万份来自 nytimes.com 的文件;
- 一个代号 Project Mango 的数据集,至少包含 160903 份来自新闻出版机构的独立作品。
法新社的报道另给了一个总量口径:OpenAI 抓取了超过 1000 万篇文章,其中接近三分之一来自《纽约时报》。这个数字和上面几组的统计口径不同,以简报原文为准。
指控里的手法有三类:绕过付费墙抓取、通过 Bing 索引做大规模爬取、在内容进入训练集之前删掉版权声明。最后一条在美国版权法里对应的是单独的条款,一旦成立,赔偿计算方式和单纯的复制侵权不一样。
两家公司的反应
微软发言人对法新社表示,Hecht 的说法是”一名员工的个人观点”,不代表公司立场。TechCrunch 在报道里写明,OpenAI 和微软都没有回复置评请求。截至发稿,两家都没有就数据集规模、付费墙和版权声明这几项具体指控公开表态,Hecht 本人也没有发声。
三年官司走到哪一步
这起案子是时报在 2023 年 12 月提起的,地点在纽约南区联邦法院,后来《每日新闻》和调查报道中心的诉讼并了进来。站内 6 月报道过时报老板苏兹贝格公开指责 AI 公司”明抢内容”,那还是报纸一方的表态;这次的分量在于,指控的措辞出自被告一方员工的内部材料。
放到同类官司里看,走得最远的一起是作者群诉 Anthropic。那起案子里法官把”用合法购得的书训练”和”从盗版库下载书”分开处理,后者直接推到了赔偿,最终以 15 亿美元左右的和解收场。时报案的指控重心落在抓取付费内容和删除版权信息上,比单纯的”训练算不算合理使用”更靠近那起案子里被判不利的部分。
至于法官会给这份演示文稿多大权重,简报本身回答不了。它证明的是微软内部有人这么看,能不能证明两家公司明知故犯,要看后续证据交换和庭审。案件目前没有公布审理日期。
参考来源:TechCrunch、华盛顿邮报、CocoLoop、法新社、Futurism;《纽约时报》未删节法律简报核验 Hecht 引语与三组数据集数量,微软发言人表态以法新社引述为准。