微軟主管內部稱AI訓練是史上最大勞動竊取

《紐約時報》控告OpenAI和微軟侵犯著作權一案,9月17日多了一份解密文件。這是時報一方提交的法律簡報,先前只以刪節版留存在案,這次公開的未刪節版本,引用了微軟一名主管在2024年1月內部簡報中的原話。

說這話的人是微軟應用科學總監布倫特.赫克特(Brent Hecht)。根據簡報的引述,他把用新聞內容訓練大型語言模型形容為:

「an astonishing theft of unprecedented proportions」(一場規模空前、令人震驚的竊取)……「the largest theft of labor in human history」(可能是人類歷史上最大的勞動竊取)

簡報還提到,赫克特曾提醒OpenAI,在系統中排查哪些內容來自時報等原告時,可能構成一次「無意間的掩蓋」(accidental cover up)。

簡報列出的幾組數字

時報一方在簡報裡整理出幾份資料集的組成,都是從案件證據揭示程序中取得的資料:

  • OpenAI的一個中期訓練資料集裡,有超過91,692份來自《紐約時報》、《每日新聞》和調查報導中心的作品副本;
  • 一份由Common Crawl衍生的資料集,含有超過200萬份來自nytimes.com的檔案;
  • 一個代號Project Mango的資料集,至少包含160,903份來自新聞出版機構的獨立作品。

法新社的報導另外給出一個總量口徑:OpenAI蒐集了超過1000萬篇文章,其中將近三分之一來自《紐約時報》。這個數字和上面幾組的統計方式不同,以簡報原文為準。

指控裡的手法分成三類:繞過付費牆蒐集內容、透過Bing索引進行大規模爬取、在內容進入訓練資料集之前刪除版權管理資訊。最後一項在美國著作權法裡對應的是獨立條款,一旦成立,賠償計算方式和單純的重製侵權不同。

兩家公司的回應

微軟發言人向法新社表示,赫克特的說法是「一名員工的個人看法」,不代表公司立場。TechCrunch在報導裡寫明,OpenAI和微軟都沒有回覆置評請求。截至發稿,兩家公司都沒有針對資料集規模、付費牆與版權資訊刪除這幾項具體指控公開表態,赫克特本人也沒有發聲。

三年官司走到哪一步

這起案子是時報在2023年12月提起的,地點在紐約南區聯邦地方法院,後來《每日新聞》和調查報導中心的訴訟併了進來。本站6月曾報導時報發行人蘇茲柏格公開指責AI公司「明目張膽偷內容」,那還是報社一方的表態;這次的分量在於,指控的措辭出自被告一方員工的內部資料。

放到同類官司裡看,走得最遠的一起是作家集體訴訟Anthropic案。那起案子裡法官把「用合法購得的書訓練」和「從盜版庫下載書」分開處理,後者直接進入賠償階段,最終以約15億美元的和解收場。時報案的指控重心落在蒐集付費內容和刪除版權資訊上,比單純的「訓練算不算合理使用」更接近那起案子裡被判不利的部分。

至於法官會給這份簡報多大權重,簡報本身回答不了。它證明的是微軟內部有人這麼看,能不能證明兩家公司明知故犯,要看後續證據揭示程序和開庭審理。案件目前沒有公布審理日期。

參考來源:TechCrunch、華盛頓郵報、CocoLoop、法新社、Futurism;《紐約時報》未刪節法律簡報核對了赫克特的引述與三組資料集數字,微軟的回應以法新社報導為準。