El 5 de octubre, OpenAI presentó un esquema de marca de agua textual llamado textGrain, pensado para cumplir con los requisitos de transparencia del Artículo 50 de la Ley de Inteligencia Artificial de la Unión Europea. En las próximas semanas, los usuarios elegibles de ChatGPT y Codex en la UE recibirán textos generados por el modelo con una capa de señal estadística invisible a simple vista pero identificable por máquinas.
Los clientes de API de todo el mundo también podrán activar manualmente esta función para algunos modelos a partir de la fecha del anuncio, desactivada por defecto. El anuncio no especifica qué modelos la admiten.
La marca de agua se esconde en la elección de palabras
textGrain actúa en el momento en que el modelo elige las palabras. Al generar texto, en muchos puntos hay varias palabras candidatas igualmente adecuadas, y OpenAI usa una clave para decidir cuál se elige finalmente. Una sola frase no muestra nada extraño, pero si el fragmento es suficientemente largo, las palabras preferidas por la clave aparecen con la frecuencia suficiente para ser identificables estadísticamente, y quien posee la clave puede usar esto para determinar si el texto proviene de un modelo con marca de agua.
Los datos de detección que ofrece OpenAI parten de una tasa de falsos positivos del 1%:
- Fragmento de 200 tokens: tasa de detección de alrededor del 80%;
- 400 tokens: alrededor del 95%;
- Fragmento de 400 tokens con el 10% de las palabras cambiadas por sinónimos: la detección baja al 66%;
- Cambiando el 25%: solo queda en 17%.
Es decir, si un lector recibe un texto generado por ChatGPT y lo reescribe un poco, la marca de agua prácticamente deja de ser reconocible. OpenAI no evita mencionar este punto en su documentación.
En cuanto a la calidad, la empresa afirma que, en ocho benchmarks, la diferencia de puntuación entre activar y desactivar la marca de agua se mantiene dentro del margen de ruido; en uno de ellos, la puntuación fue de 49,57 frente a 49,76.
El detector no está abierto al público
La parte más restringida de este esquema es la detección. OpenAI abrió un canal de solicitud ese mismo día, pero el detector solo se ofrece a "investigadores e instituciones especializadas aprobados", con revisión caso por caso. Por ahora, usuarios comunes, escuelas y editoriales no pueden verificar un texto por su cuenta.
OpenAI también delimita claramente los alcances en su documentación:
"A watermark does not measure human contribution, does not establish ownership or responsibility, does not identify the user, and does not verify accuracy."
(Una marca de agua no mide la contribución humana, no establece propiedad ni responsabilidad, no identifica al usuario y no verifica la exactitud del contenido.)
La empresa también advierte que no detectar la marca de agua no demuestra que un texto haya sido escrito por una persona.
Calendario regulatorio
El Artículo 50 de la Ley de IA de la UE exige que los proveedores de IA generativa hagan que el contenido generado sea identificable por máquinas como producido por IA. Según el calendario público, la disposición se aplica desde el 2 de agosto, con un periodo de gracia hasta el 2 de diciembre para los sistemas que ya estaban en funcionamiento antes de esa fecha. OpenAI eligió desplegar la función en la UE "en las próximas semanas", lo que coincide aproximadamente con esta ventana.
Esto también explica por qué la marca de agua solo está activada por defecto en la UE. En otras regiones, las salidas de ChatGPT y Codex permanecen, por ahora, sin marca de agua; los usuarios de API pueden activarla manualmente si lo desean.
Otros actores en el mismo camino
La marca de agua en texto es un camino en el que, durante el último año, ya se han sumado varias empresas.
Google DeepMind, con SynthID, fue el primero en hacer marcas de agua en texto, con el mismo principio de sesgar la elección de palabras durante el muestreo, y después liberó como código abierto la parte de texto; a finales de septiembre aplicó la misma idea a secuencias de proteínas diseñadas por IA. Medios extranjeros informan que la propia OpenAI considera que el rendimiento de textGrain es equivalente o ligeramente mejor que el de SynthID, una afirmación que todavía no ha sido verificada de forma independiente.
Anthropic anunció en agosto una marca de agua para la salida de texto de Claude, con un enfoque similar y el mismo problema de siempre: reescribir el texto anula su efecto. El framework de inferencia vLLM convirtió en septiembre un tipo de marca de agua basado en muestreo Gumbel en una opción integrada; las pruebas mostraron que, en escritura creativa, unos 100 tokens bastan para detectarla por completo, mientras que en tareas de código solo se detecta un 43% incluso con 400 tokens.
Al poner juntas las cifras de estas empresas, el patrón es claro: cuanto más largo y más "libre" es el texto, más fácil es reconocer la marca de agua; en cambio, en código, fórmulas y respuestas factuales muy deterministas, el margen para sesgar la elección de palabras es pequeño, por lo que la señal es naturalmente más débil. Las cifras publicadas de textGrain corresponden a texto general; OpenAI no ofreció cifras específicas para el caso del código.
Para los usuarios en China, este cambio tiene por ahora poco impacto: la marca de agua solo está activada por defecto en la UE, y en China ya no se puede acceder directamente a ChatGPT. Las "Medidas para el Etiquetado de Contenido Sintético Generado por IA" de China están en vigor desde septiembre del año pasado y exigen una combinación de etiquetado explícito y etiquetado implícito en metadatos, un enfoque distinto.
Fuentes: Declaración de transparencia de texto de OpenAI para la UE, AI Weekly, CocoLoop, Análisis técnico de CellCog; las tasas de detección se basan en una tasa de falsos positivos del 1%, y la fecha de aplicación de la ley sigue el calendario público de la UE.