El 30 de septiembre, Google DeepMind presentó SynthID Bio, un sistema que inserta marcas de agua directamente en las secuencias de aminoácidos de proteínas diseñadas por IA. El artículo de metodología se publicó simultáneamente en Nature, y el código, los datos de los experimentos in vitro y los pesos del modelo ya están abiertos a la comunidad investigadora.
La pregunta que esta herramienta busca responder es muy concreta: dada una secuencia de proteína, ¿se puede verificar que proviene de un proceso de diseño por IA de confianza? DeepMind la presenta como una herramienta de verificación de procedencia, no como un método para determinar si una proteína es peligrosa.
Cómo se inserta la marca de agua
SynthID Bio se acopla a la herramienta de diseño de proteínas ProteinMPNN. ProteinMPNN funciona colocando aminoácidos posición por posición a lo largo del esqueleto de la proteína, y en muchas posiciones existen varios candidatos con propiedades químicas similares: la leucina, la isoleucina y la valina, por ejemplo, pueden intercambiarse en bastantes posiciones.
Es justo ahí donde interviene SynthID Bio: a partir de una clave de marca de agua y de los aminoácidos ya elegidos, propone una opción. El proceso de diseño solo adopta esa sugerencia si no afecta la función de la proteína. Al observar una sola posición no se nota nada extraño, pero a lo largo de toda la secuencia, los aminoácidos que coinciden con la preferencia de la clave aparecen con más frecuencia de la que cabría esperar por azar.
La detección también se basa en estadística: quien posee la clave analiza toda la secuencia, cuenta en cuántas posiciones coincide con la sugerencia de la clave y compara el resultado con un umbral. Ars Technica advierte que la forma en que se fije ese umbral cambia directamente la proporción de falsos positivos y falsos negativos, de modo que el resultado final es un juicio probabilístico.
Resultados experimentales
El equipo utilizó el proceso con marca de agua para diseñar proteínas de unión dirigidas a tres dianas: el factor de crecimiento endotelial vascular VEGF-A, el dominio de unión al receptor (RBD) de la proteína spike del coronavirus y la proteína de punto de control inmunitario PD-L1. Las pruebas in vitro mostraron que los diseños con marca de agua mantuvieron una tasa de acierto y una afinidad de unión equivalentes a las versiones sin marca de agua, sin reducción en la diversidad de secuencias. DeepMind describe esto como los primeros ligandos proteicos con marca de agua y función biológica real.
El equipo también aplicó la misma idea a las salidas de predicción de estructura de AlphaFold 3, con una tasa de detección casi perfecta y resistencia tanto al ruido digital como a pequeños cambios de coordenadas.
"AI is expanding what scientists can design, and DNA synthesis companies have an important role in helping that innovation scale responsibly." (La IA está ampliando lo que los científicos pueden diseñar, y las empresas de síntesis de ADN tienen un papel importante en ayudar a que esa innovación se expanda de forma responsable.)
Así lo valora James Diggans, vicepresidente de políticas y bioseguridad en Twist Bioscience, empresa de síntesis de ADN.
En comparación con las marcas de agua de texto
SynthID se usó primero en imágenes y después se extendió a texto, audio y vídeo; la versión para texto se hizo de código abierto en 2024. Este sitio ya informó sobre cómo OpenAI incorporó la marca de agua de Google en ChatGPT, y sobre cómo Anthropic incrusta una marca de agua invisible en las salidas de Claude. La debilidad común de estas soluciones es la reescritura: basta reformular un fragmento de texto para que la señal estadística se diluya.
En las proteínas también existe un equivalente a esa "reescritura". Según se ha informado, las proteínas muy cortas no tienen suficiente espacio para alojar posiciones de marca de agua; añadir una secuencia natural después de un tramo con marca de agua —por ejemplo, fusionando una proteína fluorescente— diluye la señal; y muchas herramientas de diseño de proteínas no se basan en ProteinMPNN ni colocan los aminoácidos uno por uno, por lo que la marca de agua simplemente no se puede insertar. El propio DeepMind reconoce que la robustez frente a manipulaciones deliberadas sigue siendo un punto difícil.
Hay además una capa de gestión de claves: la fiabilidad de todo el sistema depende de quién posee la clave, cómo se distribuye y qué ocurre si se filtra, y por ahora no existe un acuerdo sectorial consolidado para ello.
Qué lugar ocupa en la cadena de bioseguridad
Las defensas de bioseguridad actuales se apoyan sobre todo en la etapa de síntesis de ADN: las empresas de síntesis comparan las secuencias encargadas con bases de datos de secuencias peligrosas conocidas. Las proteínas nuevas diseñadas por IA pueden no parecerse a ninguna secuencia conocida, por lo que esa comparación puede fallar. La marca de agua aporta otra pista: indica a la empresa de síntesis que esa secuencia procede de un proceso de diseño registrado.
Lo que aporta es procedencia, no ayuda a juzgar el peligro. Una secuencia sin marca de agua puede simplemente haber usado otra herramienta; una secuencia con marca de agua tampoco significa que sea inofensiva. DeepMind señala en su anuncio que ninguna medida de bioseguridad por sí sola resuelve el problema. Por ahora, DeepMind contacta con socios a través de synthidbio@google.com, y todavía está por ver cuántas empresas de síntesis y herramientas de diseño se sumarán.
Fuentes: blog oficial de Google DeepMind, artículo de metodología en Nature, CocoLoop, Ars Technica; las comparaciones de dianas, tasa de acierto y afinidad siguen el artículo y el blog oficial, y el apartado sobre limitaciones se basa en la interpretación de Ars Technica.