Kerangka kerja inferensi open source vLLM mengumumkan lewat blog resminya pada 24 September bahwa mereka menambahkan watermark teks berbasis metode Gumbel-max ke dalam framework tersebut, yang bisa diaktifkan cukup dengan satu parameter saat menjalankan server. Tulisan ini ditandatangani tiga penulis — satu dari Mistral, dua dari Red Hat.
Cara mengaktifkannya sederhana: tambahkan --watermark-config setelah perintah vllm serve, tentukan algoritmanya sebagai gumbel, lalu berikan satu kunci. Setelah itu, semua teks yang dihasilkan server tersebut akan membawa sinyal statistik yang tidak terlihat mata.
Cara Watermark Disisipkan
Setiap kali model besar menghasilkan satu kata, model itu lebih dulu memberi probabilitas ke semua kata kandidat, lalu mengambil satu di antaranya. Watermark Gumbel-max mengutak-atik langkah "pengambilan" inilah.
Caranya: dengan kunci, konteks beberapa kata terakhir, dan nomor urut kata kandidat, dihitung sekumpulan angka yang terlihat sepenuhnya acak tapi bisa direproduksi asal tahu kuncinya, lalu diubah menjadi noise Gumbel dan ditambahkan ke skor model — kandidat dengan skor tertinggi yang dipilih sebagai output. Secara matematis, distribusi hasil pengambilan seperti ini sama persis dengan sampling acak biasa, sehingga penulisnya menyebutnya "distortion-free": model tidak jadi condong ke kata tertentu, gaya penulisan tertentu, atau jenis solusi tertentu.
Pihak yang mendeteksi tidak perlu bobot model, cukup kunci dan tokenizer. Teks diubah kembali jadi token, kunci yang sama dipakai untuk menghitung ulang kumpulan angka pseudo-acak tadi, tiap token diberi skor lalu dijumlahkan, dan hasilnya dibandingkan dengan distribusi yang seharusnya muncul tanpa watermark untuk mendapatkan p-value. Menurut kalibrasi yang diberikan penulis, teks tanpa watermark punya sekitar 1% kemungkinan salah terdeteksi sebagai berwatermark.
Dua Kelompok Angka: Biaya dan Efeknya
Dari sisi performa, penulis mengujinya di satu unit H100 dengan Qwen3.5-27B untuk skenario output 512 token: throughput berubah -0,23% pada ukuran batch 1, dan +2,03% pada ukuran batch 32, dengan rata-rata tiap kelompok berkisar -1,1% hingga +2,0%. Kesimpulan penulis: tidak ada perubahan throughput yang konsisten. Untuk menghemat memori, vLLM menggabungkan pembangkitan angka pseudo-acak, transformasi Gumbel, dan pengambilan nilai maksimum menjadi satu kernel GPU.
Dari sisi kualitas model, masih dengan Qwen3.5-27B, perbandingan versi berwatermark dan tanpa watermark: GSM8K 93,0% berbanding 94,2%, MBPP 79,2% berbanding 77,2%, IFEval 90,7% berbanding 91,9% — menurut penulis, selisihnya masih dalam margin kesalahan.
Perbedaan tingkat deteksi jauh lebih besar. Pada tingkat kesalahan deteksi 1%, tulisan kreatif bisa terdeteksi penuh hanya dengan sekitar 100 token; sementara soal coding MBPP, meski ditulis sampai 400 token, tingkat deteksinya cuma 43%. Alasannya ada di prinsip kerjanya: output seperti kode membuat model sering kali sangat yakin dengan kata berikutnya, sehingga keacakan yang bisa dipakai watermark memang sedikit dari awal. Teks pendek juga sama-sama punya sinyal lemah. Saat teks diedit manusia, skor di sekitar bagian yang diubah jadi kacau, tapi sinyalnya pulih lagi begitu keluar dari rentang konteks tersebut.
Ada dua jebakan dalam implementasinya. Pertama, speculative decoding — penulis memakai dua kunci terpisah untuk menangani token draft dan sampling residual pada model target, demi menjaga tingkat penerimaan, dengan konsekuensi sinyal deteksi terpecah ke dua kunci. Kedua, konteks yang berulang bisa menghasilkan kumpulan angka acak yang sama, yang berisiko membuat model terjebak dalam pengulangan tanpa henti; solusinya adalah melewati proses watermark begitu konteks berulang terdeteksi, yang berdampak pada throughput paling banyak 0,19%.
Artinya Apa bagi Pihak yang Deploy di Tiongkok
Peraturan Tiongkok soal "Metode Penandaan Konten Hasil Kecerdasan Buatan dan Sintesis" sudah berlaku sejak September tahun lalu, mewajibkan konten hasil AI diberi penanda eksplisit atau implisit. Untuk teks, penandaan implisit selama ini kebanyakan mengandalkan metadata, sementara watermark statistik bisa disisipkan langsung ke dalam teksnya sendiri. Langkah vLLM kali ini praktis menjadikannya sebuah sakelar, sehingga banyak tim di Tiongkok yang menjalankan layanan inferensi sendiri dengan vLLM bisa langsung mencobanya.
Tapi batasan pendekatan ini juga jelas: deteksi bergantung pada kunci yang hanya dipegang pihak yang men-deploy-nya, sehingga pihak ketiga tidak bisa memverifikasi secara independen; tingkat deteksi rendah untuk kode dan balasan pendek; dan sinyalnya melemah kalau teksnya ditulis ulang secara manual dalam jumlah besar. Apakah ini bisa memenuhi persyaratan spesifik regulator soal "penandaan implisit" masih bergantung pada ada tidaknya standar deteksi pendukung ke depannya — sejauh ini belum ada acuan resmi yang dipublikasikan.
Sumber: blog resmi vLLM, CocoLoop, "Metode Penandaan Konten Hasil Kecerdasan Buatan dan Sintesis"; throughput, skor benchmark, dan tingkat deteksi semuanya berdasarkan pengujian penulis pada Qwen3.5-27B dan satu unit H100.