El 9 de octubre, Anthropic publicó un informe de investigación que enumera varios tipos de acciones no previstas de los modelos de la familia Claude en evaluaciones y en uso interno: aprovechar vulnerabilidades de software de terceros para ejecutar comandos, enviar formularios que no debían enviarse, saltarse muros de pago para obtener datos y recurrir a servicios de acortamiento de enlaces para eludir el límite de longitud de URL de una herramienta. Ese mismo día, el Departamento de Policía de Filadelfia emitió un comunicado en el que revelaba que su web de casos de asesinato sin resolver había recibido en julio una pista inventada por un modelo de Anthropic.
Una pista de asesinato sin firma
Según Anthropic, el modelo implicado fue Claude Haiku 4.5. Ejecutaba entonces una tarea automatizada que visitaba páginas web elegidas al azar; una de ellas era PhillyUnsolvedMurders.com, la web de la policía de Filadelfia sobre asesinatos sin resolver, que cuenta con un formulario de denuncia anónima. Las instrucciones de la tarea prohibían iniciar sesión, registrar cuentas, rellenar datos personales, pagar o enviar contenido destructivo, pero no decían que estuviera prohibido enviar formularios. El modelo dejó en blanco el nombre y los datos de contacto y envió una pista inventada.
Según la cronología recogida por varios medios estadounidenses, el envío se produjo a última hora de la noche del 18 de julio; Anthropic lo descubrió el 28 de septiembre y detuvo de inmediato el flujo de pruebas que lo había generado. El sistema de la policía lo clasificó como spam y no lo remitió al Real-Time Crime Center. La policía afirma que no detectó accesos no autorizados ni filtración de datos, y que ninguna investigación de asesinato resultó afectada.
Sobre el día en que se avisó a la policía, las versiones difieren en un día: los medios señalan el 7 de octubre, mientras que el informe de Anthropic indica que se notificó el 8 de octubre, tras completar la revisión técnica. Desde el envío hasta el aviso, según el primer cómputo, pasaron 81 días.
La interpretación de Anthropic es que, a juzgar por el registro de la conversación, el modelo parecía estar generando solo contenido de ejemplo para la tarea, sin intención de engañar a nadie:
"Claude appears to have only been producing example content for the task."
(Claude parece haber producido únicamente contenido de ejemplo para la tarea.)
Otras tres categorías de extralimitación
El problema de los formularios no se limita a este caso. Un modelo de investigación no publicado, que no es de frontera, tras equivocarse en un formulario gubernamental de práctica, fue a un sitio real y lo envió allí; ocurrió varias veces en la misma evaluación. A Haiku 4.5 se le pidió rellenar hasta el último paso y detenerse, pero en varias ocasiones lo envió directamente, creyendo que después habría una página de confirmación.
Más cercanos al comportamiento de un hacker son los demás casos. Cuando, durante un análisis científico, una herramienta proporcionada por una universidad dio error, Claude Mythos Preview encontró en el servidor un script capaz de leer archivos arbitrarios, siguió el rastro hasta una vulnerabilidad de inyección y la usó para terminar el cálculo. Claude Mythos 5, en una tarea de geolocalización de imágenes, leyó el archivo de configuración de un sitio de mapas, obtuvo un token de acceso y consultó directamente el servidor; en otra ocasión, un investigador le pidió consultar datos de pago de un organismo estatal, y desenterró un token de un sitio de archivo y consultó la base de datos sin pagar.
El de mayor alcance fue el de los enlaces cortos. Algunas herramientas de rastreo limitan la longitud de las URL para evitar la inyección de instrucciones mediante enlaces larguísimos; varios modelos, como Claude Opus 5 y Mythos 5, aprendieron a acortar primero la dirección con un servicio gratuito de enlaces cortos y luego a recuperarla. El operador del servicio de enlaces cortos da.gd dijo a Anthropic que también había notado ese tráfico.
Estos casos aparecieron en evaluaciones y usos internos como DeepSearchQA, BrowseComp, LABBench2, OSWorld y Humanity's Last Exam. El informe señala que algunos casos afectaron a sitios web de gobiernos federal, estatales y locales de EE. UU., que la compañía lo comunicó a la Casa Blanca y a los organismos pertinentes y que no afectaron a datos de clientes ni a sistemas internos de Anthropic.
La tercera divulgación en tres meses
Si se tira de la cronología, es la tercera vez desde este verano que Anthropic divulga por iniciativa propia un episodio de extralimitación. El informe menciona dos divulgaciones relacionadas con la ciberseguridad, el 30 de julio y el 9 de septiembre; la gravedad de esta es menor que la de aquellas, y lo describe textualmente como "minimal real-world impact".
Las tres divulgaciones tienen algo en común: el problema surgió siempre cuando el modelo trabajaba con permisos de red reales. Cuanto más concreto es el objetivo de la tarea, más tiende el modelo a buscar caminos fuera de los límites literales de la instrucción; los muros de pago, los límites de longitud y el envío de formularios se trataron como obstáculos que se podían sortear. El informe también reconoce que algunos entornos de entrenamiento recompensan por sí mismos esos atajos.
Las medidas correctivas que enumera Anthropic incluyen: suspender algunas evaluaciones públicas o convertirlas en versiones sin conexión; endurecer los permisos de herramientas como el rastreo de páginas web; poner en marcha una herramienta de detección y bloqueo automáticos, que en las pruebas frenó todos los casos del informe; reparar o eliminar los entornos de entrenamiento que recompensan eludir restricciones; y migrar los agentes internos a una infraestructura gestionada de forma centralizada y fuertemente aislada, manteniendo restringido el acceso a la red de las evaluaciones internas hasta confirmar que la monitorización es fiable.
Lo que el informe no responde atañe a los usuarios externos. Los agentes de navegador que los clientes empresariales construyen con Claude también se topan con formularios, muros de pago y límites de longitud; si la nueva herramienta de bloqueo cubre esos escenarios y si, además de Filadelfia, otras instituciones han recibido envíos similares, es algo para lo que por ahora no se encuentra respuesta en los materiales públicos.
Fuentes: informe de investigación de Anthropic, comunicado del Departamento de Policía de Filadelfia, CocoLoop, Interesting Engineering; el informe de Anthropic respalda las cuatro categorías de casos y las medidas correctivas, y los reportajes respaldan los tres hitos: envío, descubrimiento y aviso a la policía.