Claude diseña proteínas y acierta en 14 de 15 objetivos

El 18 de agosto, Anthropic publicó un registro experimental: pidió a Claude diseñar desde cero pequeñas moléculas capaces de unirse a objetivos proteicos determinados. De los 15 objetivos, 14 produjeron diseños utilizables. La síntesis y las pruebas corrieron a cargo de Adaptyv Bio y Twist Bioscience, no del propio modelo autoevaluándose.

Las cifras convencen más que cualquier conclusión resumida. En modo multiobjetivo, la tasa de éxito de Mythos Preview fue del 26,7%, y la de Opus 4.8, del 22,6%; al cambiar al modo centrado en un único objetivo, Mythos Preview subió al 35,1%. Como referencia, la tasa de éxito típica reportada públicamente en este campo se sitúa entre el 10% y el 15%. En total, los 1.320 diseños produjeron 354 ligandos validados experimentalmente, con 6 objetivos que lograron ligandos de alta afinidad, de los cuales 4 igualaron o superaron el mejor resultado publicado hasta ahora.

Algunos de los objetivos más difíciles

RBX1 es el objetivo que mejor ilustra esta diferencia. La tasa de éxito de Claude en este caso fue del 40%, mientras que la media de los participantes en una competición sobre el mismo tema fue de solo el 3,7%, y el diseño final incluso superó a la propuesta ganadora de aquel año.

Con TNFα, la prueba fue entre especies: el mismo lote de diseños debía unirse simultáneamente a las proteínas humana, de macaco y de ratón. Este punto tiene mucho peso en el desarrollo de fármacos, porque que un mismo compuesto sirva tanto para ensayos con animales como para ensayos en humanos determina directamente la duración del ciclo de desarrollo temprano.

Otro grupo se eligió precisamente por su dificultad: diseñar ligandos con alto contenido de láminas β. Este tipo de estructura ha sido históricamente difícil de abordar en el diseño computacional, porque el emparejamiento entre cadenas β deja muy poco margen de error. En esta ronda se obtuvieron 15 ligandos eficaces con un contenido de cadenas β de al menos el 20%.

Los fracasos también se documentaron oficialmente: los objetivos BBF-14 y MBP tuvieron un rendimiento pobre. Nadie confiaría en un registro experimental que solo muestra éxitos; incluir estos dos casos, por el contrario, aumenta la credibilidad del resto de los datos.

La factura del cómputo

Este proceso no es barato. El modo multiobjetivo consume hasta 12.500 horas de GPU H100 de NVIDIA por ronda, con 48 horas de tiempo real; el modo de objetivo único requiere 2.500 horas de H100 por objetivo, ejecutándose durante 24 horas. El prompt inicial ronda los treinta mil tokens.

Con los precios habituales de alquiler de H100 en la nube actual, entre 2 y 3 dólares por hora de GPU, las 12.500 horas equivalen a entre 20.000 y 30.000 dólares por ronda, lo que repartido entre 15 objetivos supone unos 2.000 dólares por objetivo. Esa cifra apenas pesa en el presupuesto del descubrimiento temprano de fármacos: una sola ronda de síntesis proteica y prueba de afinidad en laboratorio húmedo ya cuesta un orden de magnitud similar, mientras que la vía tradicional depende de varias rondas de prueba y error para acercarse a una tasa de éxito comparable. El cómputo se ha convertido en el eslabón más barato de esta cadena, una conclusión que hace pocos años no era cierta.

Una tarea extra de paso

En la misma serie de experimentos hubo también una prueba de química analítica, esta vez con Claude Opus 5. La tarea consistía en procesar datos reales de instrumentos de laboratorio: los espectros de RMN se procesaron en 23 minutos, y los datos de LC-MS, en 19 minutos. Los archivos originales de LC-MS estaban en un formato propietario, y el modelo los interpretó por sí mismo, cotejando los datos de 2.664 escaneos.

En cuanto a la precisión: el recuento de átomos de hidrógeno se desvió como máximo 0,08 ¹H respecto al resultado manual, y la pureza medida fue del 96,4%, frente a un valor de referencia del laboratorio del 96,33%. Tras completar la medición, el modelo propuso por su cuenta qué experimentos de validación realizar a continuación, y la propuesta coincidió con el plan original del laboratorio.

Esta parte puede quedar eclipsada por los datos de diseño de proteínas mencionados antes. Pero el paso que más mano de obra consume en el descubrimiento de fármacos no es el diseño, sino la lectura y el archivo diario de decenas o cientos de espectros, la rutina habitual de un investigador postdoctoral. Un modelo capaz de interpretar archivos de instrumentos en formato propietario y decidir por sí mismo el siguiente paso incide justo ahí.

Una limitación que viene incluida

Anthropic lo deja claro en el texto: la capacidad de diseño de proteínas y otras habilidades de investigación biológica de doble uso no están disponibles para usuarios comunes en Claude Fable 5. Se trata de una barrera colocada deliberadamente: la misma capacidad que sirve para diseñar ligandos también podría usarse para diseñar otras cosas, y la empresa ha optado por mantenerla en un canal controlado en lugar de incorporarla directamente a un producto de consumo.

El conjunto de datos y los prompts utilizados en el experimento ya están publicados en Hugging Face, junto con un informe técnico independiente para el diseño de proteínas y otro para el análisis químico. Que también se hayan publicado los prompts sugiere que, para Anthropic, la barrera de este método está en el cómputo y en las pruebas de laboratorio húmedo, no en la ingeniería de prompts en sí.

Fuentes: página oficial de investigación de Anthropic, registros experimentales de Adaptyv Bio y Twist Bioscience, CocoLoop, conjunto de datos público en Hugging Face; se verificó la metodología de la tasa de éxito, las horas de GPU H100 y el valor de referencia de pureza del 96,4%.