Ngày 5/10, OpenAI công bố một hệ thống watermark văn bản có tên textGrain, nhằm đáp ứng yêu cầu minh bạch tại Điều 50 của Luật Trí tuệ Nhân tạo (AI Act) của Liên minh châu Âu. Trong vài tuần tới, người dùng ChatGPT và Codex đủ điều kiện ở khu vực EU sẽ nhận văn bản do mô hình viết ra mang một lớp tín hiệu thống kê mà mắt thường không thấy được nhưng máy có thể nhận diện.
Khách hàng API trên toàn cầu cũng có thể tự bật tính năng này cho một số mô hình kể từ ngày công bố, mặc định là tắt. Thông báo không nêu rõ những mô hình nào được hỗ trợ.
Watermark ẩn trong cách chọn từ
Cách làm của textGrain là can thiệp vào bước mô hình chọn từ. Khi sinh văn bản, ở nhiều vị trí luôn có vài từ ứng viên phù hợp tương đương nhau, và OpenAI dùng một khóa bí mật để quyết định từ nào được chọn. Một câu đơn lẻ sẽ không có gì khác thường, nhưng nếu đoạn văn đủ dài, các từ được khóa "ưu tiên" sẽ xuất hiện nhiều đến mức có thể nhận ra về mặt thống kê, và bên nắm khóa dựa vào đó để xác định đoạn văn có phải từ mô hình có watermark hay không.
Số liệu phát hiện mà OpenAI đưa ra dựa trên tỷ lệ báo động giả 1%:
- Đoạn 200 token, tỷ lệ phát hiện khoảng 80%;
- Đoạn 400 token, tỷ lệ phát hiện khoảng 95%;
- Đoạn 400 token bị đổi 10% từ sang từ đồng nghĩa, tỷ lệ phát hiện giảm xuống 66%;
- Đổi 25%, chỉ còn 17%.
Nói cách khác, nếu người đọc nhận được một đoạn văn do ChatGPT tạo ra và chỉnh sửa lại đôi chút, watermark gần như không còn nhận ra được. OpenAI không né tránh điều này trong tài liệu công bố.
Về chất lượng, công ty cho biết trên tám bộ benchmark, sự khác biệt điểm số giữa việc bật và tắt watermark nằm trong phạm vi nhiễu thống kê, trong đó một bộ có điểm số 49,57 so với 49,76.
Bộ phát hiện không mở cho công chúng
Phần bị giới hạn nhiều nhất trong hệ thống này là khâu phát hiện. OpenAI mở cổng đăng ký ngay trong ngày công bố, nhưng bộ phát hiện chỉ cấp cho "các nhà nghiên cứu và tổ chức chuyên môn được phê duyệt", xét duyệt theo từng trường hợp. Người dùng thông thường, trường học, hay nhà xuất bản hiện chưa thể tự mình kiểm tra một đoạn văn.
OpenAI cũng vạch rõ giới hạn trong tài liệu công bố:
"A watermark does not measure human contribution, does not establish ownership or responsibility, does not identify the user, and does not verify accuracy."
(Watermark không đo mức độ đóng góp của con người, không xác lập quyền sở hữu hay trách nhiệm, không nhận diện người dùng, và không kiểm chứng độ chính xác.)
Công ty cũng nhắc rằng việc không phát hiện được watermark không chứng minh được đoạn văn đó do con người viết.
Lộ trình pháp lý
Điều 50 của Luật AI châu Âu yêu cầu các nhà cung cấp AI tạo sinh phải làm cho nội dung đầu ra có thể được máy nhận diện là do AI tạo ra. Theo lịch trình công khai, điều khoản này có hiệu lực từ ngày 2/8, còn với các hệ thống đã vận hành từ trước, thời hạn gia hạn tuân thủ là đến ngày 2/12. OpenAI chọn triển khai ở EU trong "vài tuần tới", nằm gần như trọn trong khung thời gian này.
Đây cũng là lý do watermark chỉ được bật mặc định ở EU. Ở các khu vực khác, đầu ra của ChatGPT và Codex hiện chưa bị gắn watermark; người dùng API nếu muốn có thể tự bật.
Những cái tên khác trên cùng con đường
Watermark văn bản là hướng đi mà trong năm qua đã có thêm nhiều công ty tham gia.
Google DeepMind với SynthID là bên làm watermark văn bản sớm nhất, cùng nguyên lý thiên vị việc chọn từ khi lấy mẫu, sau đó đã mở mã nguồn phần văn bản; cuối tháng 9, DeepMind còn áp dụng ý tưởng tương tự cho các chuỗi protein do AI thiết kế. Một số báo nước ngoài dẫn lời cho biết OpenAI tự đánh giá hiệu quả của textGrain ngang bằng hoặc nhích hơn SynthID, nhưng nhận định này chưa có bên thứ ba kiểm chứng lại.
Anthropic đã công bố watermark cho đầu ra văn bản của Claude vào tháng 8, hướng đi tương tự, và cũng gặp vấn đề cũ là "chỉnh sửa lại là mất hiệu lực". Khung suy luận vLLM vào tháng 9 đưa một kiểu watermark văn bản dựa trên lấy mẫu Gumbel thành tùy chọn tích hợp sẵn, thử nghiệm cho thấy với văn viết sáng tạo chỉ khoảng 100 token đã nhận diện được toàn bộ, còn với tác vụ code viết đến 400 token mới nhận diện được 43%.
Đặt các số liệu của những bên này cạnh nhau, điểm chung khá rõ: văn bản càng dài, càng "tự do sáng tạo" thì watermark càng dễ nhận ra; còn với code, công thức, hỏi đáp sự kiện — loại nội dung có độ xác định cao — không gian để thiên vị chọn từ nhỏ, nên tín hiệu vốn đã yếu. Số liệu textGrain công bố là trên văn bản thông thường, còn hiệu quả trong tình huống code thì OpenAI không đưa ra riêng.
Với người dùng trong nước (Trung Quốc), thay đổi lần này tạm thời chưa ảnh hưởng nhiều: watermark mặc định chỉ bật ở EU, còn trong nước vốn đã không thể truy cập trực tiếp ChatGPT. "Biện pháp quản lý nhận diện nội dung tạo sinh bằng AI" của Trung Quốc có hiệu lực từ tháng 9 năm ngoái, yêu cầu kết hợp nhận diện hiện rõ và nhận diện ẩn trong metadata, đi theo một hướng khác.
Nguồn tham khảo: Tài liệu minh bạch văn bản của OpenAI tại EU, AI Weekly, CocoLoop, Phân tích kỹ thuật CellCog; tỷ lệ phát hiện tính theo tỷ lệ báo động giả 1%, thời điểm áp dụng luật theo lịch trình công khai của EU.