Claude gắn watermark ẩn vào văn bản

Cơ chế đánh dấu mới của Claude biến một câu hỏi lâu năm thành vấn đề sản phẩm: văn bản do AI tạo ra có thể được máy nhận biết hay không?

QbitAI đưa tin ngày 11 tháng 8 rằng Anthropic đang thêm dấu ẩn vào nội dung do Claude tạo. Theo trang trợ giúp của Anthropic, các mô hình Claude mới ra mắt tại EU từ ngày 2 tháng 8 hỗ trợ đánh dấu máy đọc được ngay từ ngày đầu. Văn bản sinh ra mang watermark nhúng, còn các tệp được hỗ trợ có siêu dữ liệu nguồn gốc ký số.

Câu chữ chính thức rất ngắn:

Generated text will carry embedded watermarks
Nói theo cách người dùng dễ hiểu, một đoạn văn bản của Claude có thể mang tín hiệu không nhìn thấy bằng mắt thường và vẫn còn sau khi sao chép, dán hoặc chỉnh sửa nhẹ.

Watermark đi vào lớp đầu ra mô hình

Phạm vi Anthropic liệt kê khá rộng: Claude, Claude Platform API, Claude Code, Claude Cowork và Claude Tag; quyền truy cập qua AWS, Google Cloud và Microsoft Foundry cũng nằm trong phạm vi. Về khu vực, dấu hiệu này áp dụng ở nơi Claude cung cấp dịch vụ.

Động thái tuân thủ của Claude sâu hơn một dòng cảnh báo trên giao diện. Cảnh báo trên trang nói với con người rằng nội dung có dùng AI; tín hiệu ở tầng mô hình tạo đầu vào cho hệ thống kiểm tra tự động. Với nền tảng lớn, cách sau dễ đưa vào quy trình duyệt nội dung hơn.

EU đặt ra mốc thời gian

Bối cảnh của thay đổi này là Điều 50 của EU AI Act. Cloud Security Alliance chia nghĩa vụ minh bạch của điều này thành bốn nhóm: AI tương tác phải thông báo cho người dùng rằng họ đang tương tác với AI; hệ thống tạo âm thanh, hình ảnh, video hoặc văn bản phải đánh dấu đầu ra theo cách máy đọc được.

Nghĩa vụ minh bạch theo Điều 50 bắt đầu áp dụng từ ngày 2 tháng 8. Với hệ thống đã có trên thị trường, nghĩa vụ liên quan đến watermark có giai đoạn chuyển tiếp; CSA và The Verge đều nhắc đến cửa sổ cải tạo cho sản phẩm cũ đến ngày 2 tháng 12.

Kết quả phát hiện không phải bằng chứng tác giả

Phát hiện dấu Claude chỉ cho thấy nội dung có thể đã được Claude xử lý, chứ không tự chứng minh Claude là tác giả gốc. Người dùng viết nội dung rồi đưa cho Claude hiệu đính, dịch, tóm tắt hoặc định dạng lại cũng có thể để lại dấu. Ngược lại, không thấy dấu cũng không chứng minh nội dung không dùng AI.

Watermark càng chính thức, ranh giới càng phải rõ. Nó giảm chi phí cho nền tảng so với đoán mò hoàn toàn, nhưng cũng tạo vùng xám mới. Anthropic chưa công bố thuật toán watermark văn bản hay tài liệu kỹ thuật phát hiện. Điều doanh nghiệp có thể làm lúc này là xem kết quả phát hiện như tín hiệu rủi ro, không phải kết luận cuối cùng.

Nguồn: QbitAI, Anthropic Claude Help Center, The Verge, Cloud Security Alliance, CocoLoop, iThome; kiểm chứng phạm vi mô hình, điểm vào sản phẩm, phạm vi đám mây, loại tệp C2PA, nghĩa vụ Điều 50, cửa sổ chuyển tiếp cho mô hình cũ, giới hạn phát hiện và trạng thái tài liệu kỹ thuật chưa công bố.