Em 30 de setembro, o Google DeepMind anunciou o SynthID Bio, que insere marcas d'água diretamente nas sequências de aminoácidos de proteínas desenhadas por IA. O artigo de metodologia foi publicado simultaneamente na Nature, e o código, os dados de experimentos in vitro e os pesos do modelo já foram abertos à comunidade de pesquisa.
A pergunta que a ferramenta busca responder é específica: diante de uma sequência de proteína, é possível verificar se ela saiu de um processo de design por IA confiável? O DeepMind a posiciona como uma ferramenta de verificação de origem — ela não avalia se uma proteína é perigosa.
Como a marca d'água é inserida
O SynthID Bio opera em conjunto com a ferramenta de design de proteínas ProteinMPNN. O ProteinMPNN funciona posicionando aminoácidos um a um ao longo do esqueleto da proteína, e em muitas posições há diversos candidatos com propriedades químicas semelhantes — leucina, isoleucina e valina, por exemplo, podem ser intercambiáveis em várias posições.
É nesse ponto que o SynthID Bio atua: com base em uma chave de marca d'água e nos aminoácidos já escolhidos, ele sugere uma opção. O processo de design só adota essa sugestão se ela não comprometer a função da proteína. Observando uma única posição isoladamente, nada parece diferente; mas ao longo de toda a sequência, os aminoácidos que seguem a preferência da chave aparecem com frequência acima do esperado pelo acaso.
A detecção também é estatística: quem possui a chave examina a sequência inteira, conta quantas posições coincidem com a sugestão da chave e compara o resultado com um limiar. A Ars Technica observa que a forma como esse limiar é definido altera diretamente a proporção de falsos positivos e falsos negativos — o resultado final é, portanto, um julgamento probabilístico.
Resultados dos experimentos
A equipe usou o processo com marca d'água para desenhar proteínas de ligação para três alvos: o fator de crescimento endotelial vascular VEGF-A, o domínio de ligação ao receptor (RBD) da proteína spike do coronavírus e a proteína de checkpoint imunológico PD-L1. Testes in vitro mostraram que os desenhos com marca d'água mantiveram taxa de acerto e afinidade de ligação equivalentes às versões sem marca d'água, sem redução na diversidade das sequências. O DeepMind descreve isso como os primeiros ligantes proteicos com marca d'água e função biológica real.
A equipe também aplicou a mesma lógica às saídas de previsão de estrutura do AlphaFold 3, com uma taxa de detecção quase perfeita e resistência a ruído digital e a pequenas alterações de coordenadas.
"AI is expanding what scientists can design, and DNA synthesis companies have an important role in helping that innovation scale responsibly." (A IA está ampliando o que os cientistas conseguem desenhar, e as empresas de síntese de DNA têm um papel importante em ajudar essa inovação a crescer de forma responsável.)
A avaliação é de James Diggans, vice-presidente de políticas e biossegurança na Twist Bioscience, empresa de síntese de DNA.
Em comparação com marcas d'água de texto
O SynthID surgiu originalmente para imagens e depois foi ampliado para texto, áudio e vídeo; a versão para texto foi aberta em código em 2024. Este site já noticiou como a OpenAI incorporou a marca d'água do Google ao ChatGPT, e como a Anthropic embute uma marca d'água invisível nas saídas do Claude. A fragilidade comum a essas soluções é a reescrita: basta reformular um trecho de texto para diluir o sinal estatístico.
No caso das proteínas também existe um equivalente a essa "reescrita". Segundo reportagens, proteínas muito curtas não têm espaço suficiente para alojar posições de marca d'água; anexar uma sequência natural depois de um trecho com marca d'água — por exemplo, fundindo uma proteína fluorescente — dilui o sinal; e muitas ferramentas de design de proteínas não são baseadas no ProteinMPNN nem posicionam aminoácidos um a um, de modo que a marca d'água simplesmente não pode ser inserida. O próprio DeepMind admite que a robustez contra adulterações deliberadas ainda é um desafio.
Há ainda a questão da gestão das chaves: a credibilidade de todo o sistema depende de quem detém a chave, como ela é distribuída e o que acontece em caso de vazamento — e, por ora, não existe um arranjo setorial consolidado para isso.
Qual papel ocupa na cadeia de biossegurança
As defesas de biossegurança existentes concentram-se principalmente na etapa de síntese de DNA: as empresas de síntese comparam as sequências encomendadas com bancos de dados de sequências perigosas conhecidas. Novas proteínas desenhadas por IA podem não se parecer com nenhuma sequência conhecida, e essa comparação acaba falhando. A marca d'água oferece uma pista adicional: informa à empresa de síntese que a sequência vem de um processo de design registrado.
Ela complementa a parte de verificação de origem, mas não ajuda a julgar o risco. Uma sequência sem marca d'água pode simplesmente ter usado outra ferramenta; uma sequência com marca d'água também não significa que seja inofensiva. O DeepMind afirma no anúncio que nenhuma medida de biossegurança, isoladamente, resolve o problema. Atualmente, o DeepMind entra em contato com parceiros pelo endereço synthidbio@google.com, e ainda está por ver quantas empresas de síntese e ferramentas de design vão adotar o sistema.
Fontes: blog oficial do Google DeepMind, artigo de metodologia na Nature, CocoLoop, Ars Technica; as comparações de alvos, taxa de acerto e afinidade seguem o artigo e o blog oficial, e a seção sobre limitações baseia-se na interpretação da Ars Technica.