Claude découvre ART, un nouveau système enzymatique chez les bactériophages

Anthropic a annoncé le 23 septembre qu'un groupe d'agents Claude avait découvert, dans des bases de données publiques de séquences d'ADN, une classe de systèmes enzymatiques jamais décrite auparavant, baptisée ART (Array-Associated Reverse Transcriptases, transcriptases inverses associées à un réseau répété). Ces systèmes apparaissent surtout dans les génomes de bactériophages et leur structure rappelle, à certains égards, celle de CRISPR. L'entreprise a publié en même temps un preprint destiné à l'examen par les pairs.

Pour l'instant, seule la structure est confirmée, pas la fonction. L'utilité principale d'ART reste inconnue ; selon les propres mots d'Anthropic, les recherches correspondantes sont "ongoing" (en cours).

950 agents, 21 heures

Selon le processus révélé par Anthropic, les chercheurs n'ont fourni qu'une invite initiale ; la recherche dans la base de données, la présélection des candidats et la formulation d'hypothèses ont ensuite été entièrement prises en charge par les agents Claude.

"After 21 hours spent searching this data by roughly 950 agents using 210 million tokens, one of the agents spotted something remarkable."

En substance : environ 950 agents ont exploré ces données pendant 21 heures avec 210 millions de tokens, jusqu'à ce que l'un d'eux repère quelque chose d'inhabituel.

L'entonnoir s'est resserré par étapes : les agents ont d'abord rassemblé plus de 200 000 séquences de transcriptases inverses, en ont tiré environ 3 500 nouveaux systèmes candidats, avant de les ramener à 20 candidats jugés les plus convaincants, consignés dans un rapport remis aux chercheurs.

Le système retenu se compose de trois éléments : une transcriptase inverse, un gène associé juste à côté, et une longue série de répétitions d'ADN régulièrement espacées. Selon Anthropic, Claude semble avoir été le premier à remarquer conjointement ces deux caractéristiques déterminantes — le réseau de répétitions d'ADN non codant et cette protéine auxiliaire supplémentaire.

Des expériences préliminaires montrent que les réseaux ART s'expriment en un ensemble d'ARN courts distincts les uns des autres. Cela se rapproche du comportement des réseaux CRISPR, mais l'entreprise n'a pas conclu sur ce que font ces ARN courts à l'intérieur de la cellule.

Toutes les expériences ont été menées par des humains

La partie expérimentale (paillasse) de cette découverte a été réalisée dans un laboratoire de biologie moléculaire classique de la baie de San Francisco ; toutes les manipulations ont été effectuées par des scientifiques humains, Claude se chargeant uniquement de la recherche préalable, de la formulation d'hypothèses et de l'interprétation des données. Le laboratoire n'a traité que des échantillons de niveau de biosécurité BSL-1 et BSL-2, sans contact avec des agents pathogènes humains.

Ceci est distinct du laboratoire humide dont il était question plus tôt ce mois-ci, où Claude aurait dirigé des robots pour mener des expériences. Dans le processus présenté ici, il n'y a aucune étape d'exécution automatisée : les humains étaient à la paillasse, le modèle travaillait dans la base de données.

Feng Zhang (MIT et Broad Institute), l'un des fondateurs de l'édition génomique CRISPR, a commenté ces travaux en ces termes :

"This is an exciting example of how AI agents can contribute to biological discovery." (Un exemple passionnant de la manière dont des agents d'IA peuvent contribuer à la découverte biologique.)

À rapprocher du "phage conçu par IA"

En septembre dernier, l'Arc Institute et une équipe de Stanford avaient utilisé le modèle de langage génomique Evo pour générer une série de génomes de bactériophages, dont 16 se sont révélés capables, en laboratoire, d'infecter et de lyser la bactérie E. coli. Ce travail relevait de « l'écriture » : faire générer par le modèle des séquences qui n'existent pas dans la nature, puis vérifier en laboratoire si elles étaient viables.

ART emprunte le chemin inverse, celui de « la lecture ». Les séquences se trouvaient déjà dans les bases de données publiques ; il manquait quelqu'un pour comparer, une par une, plus de 200 000 transcriptases inverses et remarquer qu'un petit sous-groupe d'entre elles était systématiquement accompagné d'un réseau de répétitions. Cette fois, la tâche a été confiée à une machine, en 21 heures.

Les difficultés des deux approches diffèrent également. Pour la conception générative, le goulot d'étranglement se situe dans la validation expérimentale, la plupart des séquences produites par le modèle n'étant pas viables ; pour l'exploration de bases de données, le goulot d'étranglement réside dans le choix de la piste à privilégier — 950 agents ont travaillé en parallèle, mais le processus s'est finalement résumé à 20 rapports, les humains décidant ensuite quelles expériences mener.

L'histoire même de CRISPR offre un point de comparaison : en 1987, une équipe japonaise a repéré pour la première fois cette étrange séquence répétée dans le génome d'E. coli, et il a fallu plus de vingt ans avant qu'elle ne devienne un outil d'édition génomique. ART en est aujourd'hui à un stade comparable, celui du simple « repérage de la répétition » ; son évolution vers des applications concrètes dépendra des études fonctionnelles à venir et de leur reproduction par d'autres équipes.

Le preprint est désormais public. Que d'autres laboratoires parviennent ou non à reproduire de manière indépendante l'expression des ARN courts d'ART constitue la première étape permettant à la communauté scientifique de vérifier ce résultat.

Sources : blog officiel d'Anthropic, CocoLoop, preprint relatif à ART ; les chiffres concernant le nombre d'agents, la consommation de tokens et les étapes de l'entonnoir de candidats proviennent des informations communiquées par Anthropic, et le nombre de phages conçus par Evo provient de l'article publié par l'Arc Institute.