vLLM integra marca d'água de texto sem perder desempenho

O framework de inferência de código aberto vLLM anunciou em seu blog oficial, em 24 de setembro, a incorporação de uma marca d'água textual baseada no método Gumbel-max, que pode ser ativada no servidor com um único parâmetro de inicialização. O artigo é assinado por três autores, um da Mistral e dois da Red Hat.

Ativar é simples: basta acrescentar --watermark-config ao comando vllm serve, indicando o algoritmo gumbel e informando uma chave. A partir daí, todo o texto gerado por esse servidor carrega um sinal estatístico invisível a olho nu.

Como a marca d'água é escondida

A cada palavra gerada, um modelo grande atribui uma probabilidade a todas as palavras candidatas e depois sorteia uma delas. É exatamente nessa etapa de "sorteio" que a marca d'água Gumbel-max atua.

Na prática, a chave, o contexto das palavras mais recentes e o índice da palavra candidata são usados para calcular uma sequência de números que parece totalmente aleatória, mas pode ser reproduzida por quem conhece a chave; essa sequência é transformada em ruído Gumbel e somada à pontuação do modelo, tomando-se o maior valor como saída. Matematicamente, o resultado desse sorteio tem distribuição idêntica à de uma amostragem aleatória comum, por isso os autores chamam o método de "livre de distorção": o modelo não passa a favorecer certas palavras, um estilo de escrita ou um tipo de solução.

O lado da detecção não precisa dos pesos do modelo, apenas da chave e do tokenizador. O texto é convertido de volta em tokens, a mesma chave recalcula a sequência pseudoaleatória, cada token recebe uma pontuação que é somada e comparada com a distribuição esperada sem marca d'água, gerando um valor-p. Segundo a calibração dada pelos autores, cerca de 1% dos textos sem marca d'água acabam sendo apontados por engano.

Dois conjuntos de números sobre custo e eficácia

Em desempenho, os autores testaram em uma única H100 com o Qwen3.5-27B, gerando 512 tokens: com batch size 1, o throughput variou -0,23%; com batch size 32, +2,03%; as médias dos grupos ficaram entre -1,1% e +2,0%, e a conclusão dos autores é que não há variação consistente de throughput. Para economizar memória de GPU, o vLLM combinou a geração de números pseudoaleatórios, a transformação Gumbel e o cálculo do máximo em um único kernel de GPU.

Em qualidade do modelo, também com o Qwen3.5-27B, a comparação com e sem marca d'água foi: GSM8K 93,0% contra 94,2%, MBPP 79,2% contra 77,2%, IFEval 90,7% contra 91,9%, diferenças que os autores consideram dentro da margem de erro.

A diferença na taxa de detecção, porém, é grande. Com 1% de taxa de falso positivo, textos criativos alcançam detecção total com cerca de 100 tokens; já em tarefas de código do MBPP, mesmo com 400 tokens, a taxa de detecção fica em apenas 43%. A razão está no próprio princípio: em saídas de código, o modelo costuma ter alta confiança sobre a próxima palavra, restando pouca aleatoriedade para a marca d'água explorar. Textos curtos sofrem do mesmo problema de sinal fraco. Quando um texto é editado por humanos, as pontuações próximas ao trecho alterado ficam embaralhadas, mas o sinal se recupera fora dessa região.

Na implementação, há ainda duas armadilhas. Uma é a decodificação especulativa: os autores usam duas chaves separadas para os tokens de rascunho e para a amostragem residual do modelo-alvo, preservando a taxa de aceitação ao custo de dividir o sinal de detecção entre as duas chaves. A outra é que contextos repetidos geram a mesma sequência de números aleatórios, o que pode levar o modelo a uma repetição infinita; a solução é pular a marca d'água quando há contexto repetido, medida que afeta o throughput em no máximo 0,19%.

O que isso significa para quem opera na China

As Medidas para Rotulagem de Conteúdo Gerado e Sintético por IA, da China, estão em vigor desde setembro do ano passado e exigem que conteúdos gerados tragam rotulagem explícita ou implícita. Aplicada a texto, a rotulagem implícita hoje depende sobretudo de metadados, enquanto uma marca d'água estatística pode ser embutida no próprio texto; com essa novidade, o vLLM transformou isso em um interruptor pronto para uso, e as muitas equipes na China que operam serviços de inferência próprios com vLLM podem testá-lo diretamente.

Mas os limites dessa solução também são claros: a detecção depende da chave, que fica em poder de quem a implanta, sem verificação independente por terceiros; a taxa de detecção é baixa para código e respostas curtas; e reescritas humanas extensas enfraquecem o sinal. Se isso é suficiente para atender às exigências específicas dos reguladores sobre "rotulagem implícita" ainda depende de eventuais padrões de detecção que venham a ser definidos — por ora, não há posição pública sobre o assunto.

Fontes: blog oficial do vLLM, CocoLoop, Medidas para Rotulagem de Conteúdo Gerado e Sintético por IA; os números de throughput, benchmarks e taxas de detecção seguem os critérios de teste dos autores com o Qwen3.5-27B em uma única H100.