Anthropic chi 1,5 tỷ USD dàn xếp vụ kiện bản quyền dữ liệu huấn luyện AI

Một cuộc chiến pháp lý kéo dài nhiều năm đang khép lại bằng tiền mặt thật.

Vụ kiện tập thể về bản quyền giữa Anthropic và gần 500.000 tác giả (Bartz et al. v. Anthropic) đã đạt được thỏa thuận dàn xếp trị giá 1,5 tỷ USD. Phiên điều trần phê duyệt cuối cùng sẽ diễn ra vào ngày 14 tháng 5; nếu thẩm phán thông qua, số tiền này sẽ chính thức được giải ngân.

Đây là khoản dàn xếp bản quyền lớn nhất trong ngành AI từ trước đến nay. Tuy nhiên, ý nghĩa của vụ việc không chỉ dừng lại ở con số "Anthropic phải trả bao nhiêu". Điều đáng chú ý hơn là những ranh giới pháp lý mà tòa án đã vạch ra trong quá trình này – ranh giới sẽ ảnh hưởng đến cách toàn bộ ngành xử lý dữ liệu huấn luyện trong tương lai.

Có thể huấn luyện bằng sách có bản quyền, nhưng không được dùng nguồn vi phạm bản quyền

Logic phán quyết cốt lõi của vụ án này đáng được xem xét kỹ lưỡng.

Tòa án xác định việc sử dụng tác phẩm có bản quyền để huấn luyện mô hình ngôn ngữ lớn thuộc diện sử dụng hợp lý (fair use). Nguyên văn phán quyết nêu rõ, "mục đích sử dụng dữ liệu huấn luyện mang tính chuyển đổi – thậm chí là cực kỳ chuyển đổi". Nói cách khác, việc sử dụng sách có bản quyền để huấn luyện Claude, về mặt pháp lý, bản thân nó không có vấn đề.

Tuy nhiên, vấn đề của Anthropic nằm ở một khía cạnh khác: kho ngữ liệu huấn luyện mà họ sử dụng có chứa các tác phẩm vi phạm bản quyền. Việc tải xuống hàng triệu cuốn sách lậu – dù mục đích cuối cùng là huấn luyện AI – là một hành vi vi phạm độc lập, không được bảo vệ bởi nguyên tắc sử dụng hợp lý.

Do đó, 1,5 tỷ USD này giải quyết vấn đề "nguồn dữ liệu vi phạm bản quyền", chứ không phải "bản thân hành vi huấn luyện AI".

Có thể huấn luyện, nhưng phải sử dụng dữ liệu từ nguồn hợp pháp. Đây là ranh giới pháp lý AI rõ ràng nhất của năm 2026.

Là một phần của thỏa thuận dàn xếp, Anthropic cũng bị yêu cầu hủy bỏ bộ dữ liệu vi phạm bản quyền đó. Vừa phải bồi thường tiền, vừa phải xóa dữ liệu.

Mỗi tác giả sẽ nhận được khoảng 3.000 USD trước khi trừ phí luật sư. 500.000 người chia 1,5 tỷ USD, trung bình là con số đó. Không nhiều, nhưng bản chất của kiện tập thể không phải để làm giàu cho từng cá nhân – ý nghĩa của nó là thiết lập các quy tắc.

Ngành công nghiệp âm nhạc cũng đang thanh toán, với cách linh hoạt hơn

Không chỉ ngành xuất bản. Hai vụ kiện lớn trong ngành công nghiệp âm nhạc cũng đã kết thúc trong thời gian này:

  • Universal Music vs Udio: Hai bên đạt được thỏa thuận dàn xếp và đồng thời ký kết thỏa thuận cấp phép chính thức. Tiền đã được trả, dữ liệu trong tương lai sẽ là dữ liệu được cấp phép
  • Warner Music vs Suno: Trong các điều khoản dàn xếp, Suno cam kết phát triển một sản phẩm hoàn toàn mới bằng cách sử dụng "mô hình cấp phép tiên tiến hơn" – nghĩa là không chỉ bồi thường tiền, mà còn phải thay thế mô hình hiện tại bằng phiên bản được huấn luyện trên dữ liệu bản quyền hợp pháp

Cách tiếp cận của ngành công nghiệp âm nhạc này thông minh hơn ngành xuất bản: không chỉ đòi bồi thường, mà biến việc dàn xếp thành điểm khởi đầu để thiết lập mối quan hệ cấp phép dài hạn. Bên nắm bản quyền nhận được tiền và cả doanh thu cấp phép dữ liệu trong tương lai.

Đầu ra của AI không thể được đăng ký bản quyền

Đồng thời, Tòa án Tối cao vào ngày 2 tháng 3 đã ra phán quyết từ chối xem xét vụ Thaler v. Perlmutter.

Vụ kiện này cố gắng giành quyền bảo hộ bản quyền cho nội dung do AI tạo ra. Việc Tòa án Tối cao từ chối đồng nghĩa với việc duy trì phán quyết của tòa án cấp dưới: Tác phẩm do AI tạo ra, nếu không có đóng góp sáng tạo của con người, không thể được cấp bản quyền.

Điều này có tác động trực tiếp đến logic kinh doanh của các công cụ AI:

  • Bài viết người dùng viết bằng Claude: người dùng có bản quyền
  • Nội dung Claude "sáng tạo" mà không có bất kỳ hướng dẫn nào từ con người: không có bản quyền, bất kỳ ai cũng có thể sử dụng

Quy tắc này về cơ bản đã được xác định và sẽ không thay đổi.

Thomson Reuters thắng kiện, dữ liệu pháp lý là một ranh giới khác

Có một ngoại lệ trong các vụ kiện bản quyền AI, đi theo logic khác: Thomson Reuters kiện công cụ nghiên cứu pháp lý AI Ross Intelligence, cáo buộc họ sao chép các phần tóm tắt (headnotes) của Westlaw để huấn luyện.

Tòa án phán quyết: Điều này không cấu thành sử dụng hợp lý.

Tại sao lại khác với vụ Bartz? Hai điểm khác biệt chính:

  1. Các phần tóm tắt pháp lý là sản phẩm biên tập của Thomson Reuters, không phải tài liệu gốc
  2. Ross và Westlaw có mối quan hệ cạnh tranh trực tiếp, tòa án cho rằng việc sử dụng này không mang tính chuyển đổi

Phán quyết này hiện đang được kháng cáo. Nó cho thấy ranh giới của "sử dụng hợp lý" không phải là một khối bê tông cốt thép; mối quan hệ cạnh tranh và bản chất của dữ liệu đều ảnh hưởng đến phán quyết.

Một số vụ kiện lớn vẫn đang tiếp diễn

Một số vụ kiện quan trọng vẫn chưa có kết quả:

  • In Re OpenAI kiện tập thể vi phạm bản quyền: 12 vụ kiện được hợp nhất thành MDL, vấn đề cốt lõi là liệu đầu ra của ChatGPT có vi phạm bản quyền hay không
  • Disney và các bên khác vs Midjourney: Vụ án treo quan trọng nhất trong lĩnh vực tạo hình ảnh, ảnh hưởng trực tiếp đến tương lai của các công cụ văn bản thành hình ảnh
  • Kadrey et al. vs Meta: Liệu việc phân phối và sử dụng các mô hình nguồn mở có cấu thành vi phạm bản quyền hay không, vẫn chưa có kết luận

Đối với hướng tạo hình ảnh và vi phạm bản quyền đầu ra AI, các tiền lệ pháp lý vẫn chưa được thiết lập, đây là những khu vực bất ổn pháp lý lớn nhất hiện nay.

Các quy tắc gần như đã được định hình

Đối với các công ty AI, từ loạt phán quyết và dàn xếp này có thể đọc ra một số tín hiệu rõ ràng:

  1. Bản thân việc huấn luyện về cơ bản là sử dụng hợp lý, nhưng nguồn dữ liệu vi phạm bản quyền là rủi ro độc lập, đừng tiết kiệm khoản tiền này
  2. Mô hình "cấp phép + dàn xếp" của ngành công nghiệp âm nhạc có thể trở thành trạng thái bình thường mới, các bên nắm bản quyền ngày càng có xu hướng nhận cấp phép thay vì chỉ nhận bồi thường
  3. Tạo hình ảnh và vi phạm bản quyền đầu ra vẫn là bãi mìn, tốt nhất đừng đặt cược vào việc "chờ tiền lệ ra rồi tính"
  4. Đầu ra AI không có bản quyền – quy tắc này đã được xác định, mô hình kinh doanh cần tránh các tuyên bố bản quyền "nội dung gốc do AI tạo ra"

1,5 tỷ USD của Anthropic là một con số lớn, nhưng xét theo quy mô doanh thu hiện tại của họ, đây là khoản tiền mua sự chắc chắn. Chi phí tuân thủ dữ liệu cuối cùng vẫn rẻ hơn sự bất ổn của việc kiện tụng.

Nguồn tham khảo: AI in litigation series: An update on AI copyright cases in 2026 (Norton Rose Fulbright); CocoLoop, Bartz v. Anthropic Settlement: What Authors Need to Know (The Authors Guild); AI Copyright Lawsuit Developments in 2025: A Year in Review (Copyright Alliance); Generative AI Lawsuits Timeline (Sustainable Tech Partner)