Framework suy luận mã nguồn mở vLLM vừa thông báo trên blog chính thức ngày 24/9 rằng đã tích hợp watermark văn bản dựa trên phương pháp Gumbel-max, phía server chỉ cần một tham số khởi động là bật được. Bài viết do ba tác giả đứng tên, một người đến từ Mistral, hai người đến từ Red Hat.
Cách bật rất đơn giản: thêm --watermark-config vào sau lệnh vllm serve, khai báo thuật toán là gumbel rồi cung cấp một khóa bí mật. Sau đó, toàn bộ văn bản mà server này sinh ra sẽ mang tín hiệu thống kê không thể nhìn thấy bằng mắt thường.
Watermark được giấu vào đâu
Mỗi khi sinh ra một từ, mô hình lớn sẽ gán xác suất cho tất cả các từ ứng viên rồi rút ra một từ trong số đó. Watermark Gumbel-max can thiệp chính vào bước "rút" này.
Cách làm cụ thể: dùng khóa bí mật, ngữ cảnh của vài từ gần nhất và chỉ số của từ ứng viên để tính ra một dãy số trông có vẻ hoàn toàn ngẫu nhiên nhưng chỉ cần biết khóa là tái tạo lại được, biến đổi dãy số đó thành nhiễu Gumbel rồi cộng vào điểm số của mô hình, sau đó lấy giá trị lớn nhất làm đầu ra. Về mặt toán học, kết quả rút ra theo cách này có phân phối hoàn toàn giống với lấy mẫu ngẫu nhiên thông thường, nên tác giả gọi đây là phương pháp "không làm biến dạng": mô hình sẽ không vì vậy mà thiên vị một số từ, một phong cách văn phong hay một loại cách giải nào đó.
Bên kiểm tra không cần trọng số mô hình, chỉ cần khóa bí mật và bộ tokenizer. Văn bản được chuyển lại thành token, dùng cùng khóa bí mật để tính lại dãy số giả ngẫu nhiên đó, chấm điểm từng token rồi cộng lại, so với phân phối lẽ ra phải có khi không có watermark để tính ra một giá trị p. Theo cách hiệu chỉnh mà tác giả đưa ra, văn bản không có watermark có khoảng 1% khả năng bị báo nhầm.
Hai bộ số về cái giá phải trả và hiệu quả
Về hiệu năng, tác giả đã thử nghiệm trên một GPU H100 với mô hình Qwen3.5-27B, sinh 512 token: ở batch size 1, thông lượng thay đổi -0,23%; ở batch size 32 là +2,03%; trung bình các nhóm dao động từ -1,1% đến +2,0%, và tác giả kết luận không có sự thay đổi thông lượng nhất quán. Để tiết kiệm bộ nhớ GPU, vLLM đã gộp việc sinh số giả ngẫu nhiên, biến đổi Gumbel và lấy giá trị lớn nhất vào chung một GPU kernel.
Về chất lượng mô hình, vẫn với Qwen3.5-27B, so sánh có watermark và không có watermark: GSM8K đạt 93,0% so với 94,2%, MBPP đạt 79,2% so với 77,2%, IFEval đạt 90,7% so với 91,9%; tác giả cho rằng các chênh lệch này đều nằm trong biên độ sai số.
Khác biệt lớn nằm ở tỷ lệ phát hiện. Ở ngưỡng báo nhầm 1%, văn bản sáng tạo chỉ cần khoảng 100 token là phát hiện được toàn bộ; còn với bài toán code MBPP viết đến 400 token, tỷ lệ phát hiện chỉ đạt 43%. Nguyên nhân nằm ở chính nguyên lý: với các đầu ra dạng code, mô hình thường rất chắc chắn về từ tiếp theo, nên độ ngẫu nhiên có thể khai thác cho watermark vốn đã ít. Văn bản ngắn cũng gặp vấn đề tín hiệu yếu tương tự. Khi văn bản bị con người chỉnh sửa, điểm số ở khu vực bị sửa sẽ bị xáo trộn, nhưng ra khỏi đoạn đó thì tín hiệu vẫn phục hồi được.
Về mặt triển khai còn hai điểm cần lưu ý. Một là giải mã suy đoán (speculative decoding): tác giả dùng hai khóa riêng để xử lý token nháp và phần lấy mẫu phần dư của mô hình đích, nhằm giữ tỷ lệ chấp nhận, cái giá là tín hiệu phát hiện bị chia cho hai khóa. Hai là ngữ cảnh lặp lại sẽ tạo ra cùng một dãy số ngẫu nhiên, có thể khiến mô hình rơi vào lặp vô hạn; cách xử lý là bỏ qua watermark khi gặp ngữ cảnh lặp lại, bước này ảnh hưởng tới thông lượng tối đa 0,19%.
Ý nghĩa đối với các bên triển khai tại Trung Quốc
Biện pháp gắn nhãn nội dung tổng hợp do AI tạo ra của Trung Quốc đã có hiệu lực từ tháng 9 năm ngoái, yêu cầu nội dung do AI sinh ra phải có nhãn hiển thị hoặc nhãn ẩn. Áp vào văn bản, nhãn ẩn hiện nay chủ yếu dựa vào metadata, trong khi watermark thống kê có thể nhúng trực tiếp vào chính văn bản; lần này vLLM coi như đã biến nó thành một công tắc bật/tắt, các đội ngũ tại Trung Quốc đang tự triển khai dịch vụ suy luận bằng vLLM có thể thử ngay.
Nhưng giới hạn của giải pháp này cũng rất rõ: việc phát hiện phụ thuộc vào khóa bí mật, ai triển khai thì người đó giữ khóa, bên thứ ba không thể tự kiểm chứng độc lập; tỷ lệ phát hiện với code và câu trả lời ngắn còn thấp; khi bị con người chỉnh sửa nhiều, tín hiệu sẽ bị suy yếu. Liệu giải pháp này có đáp ứng được yêu cầu cụ thể của cơ quan quản lý về "nhãn ẩn" hay không còn phải chờ xem có tiêu chuẩn kiểm định đi kèm hay không, hiện chưa có hướng dẫn công khai.
Nguồn tham khảo: blog chính thức của vLLM, CocoLoop, Biện pháp gắn nhãn nội dung tổng hợp do AI tạo ra; các số liệu về thông lượng, điểm benchmark và tỷ lệ phát hiện đều theo cách đo của tác giả trên Qwen3.5-27B và một GPU H100.