Le 30 septembre, Google DeepMind a présenté SynthID Bio, un outil qui inscrit un filigrane directement dans les séquences d'acides aminés des protéines conçues par IA. L'article de méthodologie a été publié simultanément dans Nature, et le code, les données d'expériences in vitro et les poids du modèle sont désormais ouverts à la communauté de recherche.
La question à laquelle cet outil veut répondre est précise : face à une séquence protéique donnée, peut-on vérifier qu'elle provient bien d'un processus de conception par IA digne de confiance ? DeepMind le présente comme un outil de vérification de provenance, pas comme un moyen de juger si une protéine est dangereuse.
Comment le filigrane est inséré
SynthID Bio se greffe sur l'outil de conception de protéines ProteinMPNN. ProteinMPNN fonctionne en plaçant les acides aminés un par un le long du squelette de la protéine, et à de nombreuses positions, plusieurs candidats aux propriétés chimiques proches sont possibles — la leucine, l'isoleucine et la valine, par exemple, sont interchangeables à de nombreuses positions.
C'est précisément à cette étape que SynthID Bio intervient : à partir d'une clé de filigrane et des acides aminés déjà choisis, il propose une suggestion. Le processus de conception ne retient cette suggestion que si elle ne nuit pas à la fonction de la protéine. Observée isolément, aucune position ne paraît anormale, mais sur l'ensemble de la séquence, les acides aminés conformes à la préférence de la clé apparaissent plus souvent que ne le voudrait le hasard.
La détection repose elle aussi sur la statistique : celui qui détient la clé analyse l'ensemble de la séquence, compte le nombre de positions qui correspondent à la suggestion de la clé, puis compare le résultat à un seuil. Ars Technica souligne que la manière de fixer ce seuil modifie directement la proportion de faux positifs et de faux négatifs, si bien que le résultat final reste un jugement probabiliste.
Résultats expérimentaux
L'équipe a utilisé ce processus filigrané pour concevoir des protéines de liaison visant trois cibles : le facteur de croissance endothélial vasculaire VEGF-A, le domaine de liaison au récepteur (RBD) de la protéine spike du coronavirus, et la protéine de point de contrôle immunitaire PD-L1. Les tests in vitro ont montré que les conceptions filigranées conservaient un taux de réussite et une affinité de liaison équivalents à ceux des versions sans filigrane, sans baisse de la diversité des séquences. DeepMind qualifie ces résultats de premiers liants protéiques à la fois filigranés et biologiquement fonctionnels.
L'équipe a également appliqué la même approche aux sorties de prédiction de structure d'AlphaFold 3, avec un taux de détection proche de la perfection et une bonne résistance au bruit numérique ainsi qu'à de petites modifications de coordonnées.
"AI is expanding what scientists can design, and DNA synthesis companies have an important role in helping that innovation scale responsibly." (L'IA élargit ce que les scientifiques peuvent concevoir, et les entreprises de synthèse d'ADN ont un rôle important à jouer pour permettre à cette innovation de se développer de façon responsable.)
C'est l'avis de James Diggans, vice-président chargé des politiques et de la biosécurité chez Twist Bioscience, une entreprise de synthèse d'ADN.
Comparaison avec les filigranes de texte
SynthID a d'abord été utilisé pour les images, avant d'être étendu au texte, à l'audio et à la vidéo ; la version texte a été rendue open source en 2024. Ce site a déjà rapporté comment OpenAI a intégré le filigrane de Google dans ChatGPT, et comment Anthropic insère un filigrane invisible dans les sorties de Claude. La faiblesse commune à ces solutions est la réécriture : il suffit de reformuler un passage pour diluer le signal statistique.
Côté protéines, il existe un équivalent à cette « réécriture ». Selon les comptes rendus, une protéine trop courte ne contient pas assez de positions pour accueillir un nombre suffisant de marques de filigrane ; ajouter une séquence naturelle après un segment filigrané — en fusionnant par exemple une protéine fluorescente — dilue le signal ; et de nombreux outils de conception de protéines ne s'appuient pas sur ProteinMPNN ou ne placent pas les acides aminés un par un, si bien que le filigrane ne peut pas y être intégré. DeepMind reconnaît lui-même que la robustesse face à une altération délibérée reste un point difficile.
S'ajoute à cela la question de la gestion des clés : la fiabilité de tout le système dépend de qui détient la clé, de la façon dont elle est distribuée et de ce qui se passe en cas de fuite — un dispositif sectoriel abouti n'existe pas encore sur ce point.
Sa place dans la chaîne de biosécurité
Les défenses de biosécurité actuelles reposent surtout sur l'étape de synthèse d'ADN : les entreprises de synthèse comparent les séquences commandées à des bases de données de séquences dangereuses connues. Or, de nouvelles protéines conçues par IA peuvent ne ressembler à aucune séquence connue, ce qui fait passer cette comparaison à côté. Le filigrane apporte un indice supplémentaire : il indique à l'entreprise de synthèse que cette séquence provient d'un processus de conception enregistré.
Il comble ainsi un manque côté provenance, mais n'aide pas à juger de la dangerosité. Une séquence sans filigrane peut simplement avoir été produite avec un autre outil ; une séquence filigranée ne signifie pas pour autant qu'elle soit inoffensive. DeepMind précise dans son annonce qu'aucune mesure de biosécurité, prise isolément, ne peut résoudre le problème. DeepMind est actuellement joignable par les partenaires via synthidbio@google.com, et il reste à voir combien d'entreprises de synthèse et d'outils de conception s'y intégreront.
Sources : blog officiel de Google DeepMind, article de méthodologie dans Nature, CocoLoop, Ars Technica ; les comparaisons de cibles, de taux de réussite et d'affinité suivent l'article et le blog officiel, et la partie sur les limites s'appuie sur l'interprétation d'Ars Technica.