Giám đốc Microsoft nội bộ gọi việc huấn luyện AI là vụ trộm lao động lớn nhất lịch sử

Vụ kiện bản quyền của The New York Times nhắm vào OpenAI và Microsoft có thêm một tài liệu được giải mật vào ngày 17 tháng 9. Đây là một hồ sơ pháp lý do phía Times nộp, trước đó được lưu trữ ở bản đã lược bỏ nội dung, lần này phần chưa lược bỏ được công bố, trong đó trích nguyên văn lời một giám đốc Microsoft tại một buổi trình bày nội bộ vào tháng 1 năm 2024.

Người phát biểu là Brent Hecht, Giám đốc khoa học ứng dụng của Microsoft. Theo trích dẫn trong hồ sơ, ông mô tả việc dùng nội dung báo chí để huấn luyện các mô hình lớn là:

"an astonishing theft of unprecedented proportions" / "the largest theft of labor in human history"

Một vụ trộm cắp ở quy mô chưa từng có, gây sốc, có thể là vụ trộm lao động lớn nhất trong lịch sử loài người.

Hồ sơ còn cho biết Hecht từng cảnh báo OpenAI rằng khi rà soát hệ thống xem nội dung nào đến từ các nguyên đơn như Times, việc này có thể trở thành một "sự che giấu ngoài ý muốn" (accidental cover up).

Những con số trong hồ sơ

Phía Times đưa ra cấu trúc của một số bộ dữ liệu trong hồ sơ, đều được tổng hợp từ tài liệu thu thập chứng cứ của vụ án:

  • Một bộ dữ liệu huấn luyện trung gian của OpenAI chứa hơn 91.692 bản sao tác phẩm từ The New York Times, Daily News và Trung tâm Báo chí Điều tra (Center for Investigative Reporting);
  • Một bộ dữ liệu bắt nguồn từ Common Crawl chứa hơn 2 triệu tệp từ nytimes.com;
  • Một bộ dữ liệu có tên mã Project Mango chứa ít nhất 160.903 tác phẩm độc lập từ các cơ quan báo chí.

Hãng tin AFP đưa ra một con số tổng khác: OpenAI đã thu thập hơn 10 triệu bài viết, trong đó gần một phần ba đến từ The New York Times. Con số này dùng cách tính khác với các số liệu trên, nên lấy nguyên văn hồ sơ làm chuẩn.

Các cáo buộc về thủ thuật thu thập chia làm ba loại: vượt tường phí để thu thập nội dung, thu thập quy mô lớn thông qua chỉ mục của Bing, và xóa thông báo bản quyền trước khi đưa nội dung vào tập huấn luyện. Điều cuối cùng tương ứng với một điều khoản riêng trong luật bản quyền Mỹ, nếu được xác nhận thì cách tính bồi thường sẽ khác với vi phạm sao chép thông thường.

Phản ứng của hai công ty

Người phát ngôn Microsoft nói với AFP rằng phát biểu của Hecht là "quan điểm cá nhân của một nhân viên", không đại diện cho lập trường công ty. TechCrunch cho biết trong bài viết rằng cả OpenAI và Microsoft đều không phản hồi yêu cầu bình luận. Tính đến thời điểm đăng tin, cả hai công ty đều chưa công khai lên tiếng về quy mô bộ dữ liệu, tường phí hay việc xóa thông tin bản quyền, và bản thân Hecht cũng chưa phát biểu gì.

Vụ kiện ba năm đã đi đến đâu

Vụ kiện được Times khởi xướng vào tháng 12 năm 2023, tại Tòa án Liên bang Quận Nam New York, sau đó các vụ kiện của Daily News và Trung tâm Báo chí Điều tra được sáp nhập vào. Trang này từng đưa tin hồi tháng 6 rằng ông chủ của Times, Sulzberger, công khai cáo buộc các công ty AI "trắng trợn cướp nội dung" — đó là phát biểu từ phía tờ báo; lần này trọng lượng nằm ở chỗ cáo buộc lại xuất phát từ chính tài liệu nội bộ của nhân viên bên bị đơn.

So với các vụ kiện cùng loại, vụ đi xa nhất là vụ kiện tập thể của các tác giả nhắm vào Anthropic. Trong vụ đó, thẩm phán tách riêng việc "dùng sách mua hợp pháp để huấn luyện" và việc "tải sách từ thư viện lậu", vế sau bị đẩy thẳng đến bồi thường và cuối cùng kết thúc bằng khoản dàn xếp khoảng 1,5 tỷ đô la. Trọng tâm cáo buộc trong vụ Times nằm ở việc thu thập nội dung trả phí và xóa thông tin bản quyền, gần với phần bị xử bất lợi trong vụ kia hơn là câu hỏi đơn thuần "huấn luyện có tính là sử dụng hợp lý hay không".

Còn thẩm phán sẽ đánh giá bản trình bày này nặng đến đâu thì bản thân hồ sơ không trả lời được. Nó chỉ chứng minh rằng nội bộ Microsoft có người nghĩ như vậy; có chứng minh được cả hai công ty biết rõ vẫn làm hay không còn phụ thuộc vào quá trình trao đổi chứng cứ và phiên xét xử sau này. Vụ án hiện chưa công bố ngày xét xử.

Nguồn tham khảo: TechCrunch, Washington Post, CocoLoop, AFP, Futurism; hồ sơ pháp lý chưa lược bỏ của The New York Times xác nhận lời trích của Hecht và ba bộ số liệu, phát biểu của người phát ngôn Microsoft dựa theo trích dẫn của AFP.