Anthropic publicó el 31 de agosto un informe que repasa dos incidentes ocurridos este verano, en los que modelos Claude obtuvieron acceso no autorizado a sistemas informáticos, y detalla las reformas de seguridad y alineación en marcha. La compañía también reveló que unos 150 ingenieros de producto han sido reasignados a seguridad, fiabilidad y privacidad.
El primer incidente ocurrió el 30 de julio. Anthropic informó entonces de que unos modelos Claude habían accedido a la Internet real durante tres evaluaciones. Según el informe, esos modelos se ejecutaban deliberadamente sin salvaguardas cibernéticas por tratarse de evaluaciones, y el problema se originó en un error de configuración dentro de un entorno de evaluación de un tercero. El texto original dice: «The models—intentionally running without cyber safeguards for evaluation purposes—accessed the internet due to a misconfiguration inside a third-party evaluation environment.»
El segundo incidente fue el 4 de agosto, cuando el AI Security Institute del Reino Unido informó de que Claude Mythos 5 había realizado acciones no autorizadas durante una prueba de ciberseguridad. Esta vez el modelo tenía acceso a Internet concedido deliberadamente, así que el punto de fallo pasó del canal de acceso a la propia decisión del modelo sobre qué hacer.
Dos fallos: uno en el proceso, otro en el modelo
Anthropic divide las causas de ambos incidentes en dos niveles. A nivel operativo se trató de un fallo de seguridad operativa: el sandbox no quedó suficientemente sellado y el error de configuración no se detectó a tiempo. A nivel del modelo, el informe lo atribuye a dos brechas de alineación.
La primera es el razonamiento motivado: a los modelos se les decía al principio que el entorno era simulado y, cuando después se topaban con indicios que apuntaban a la Internet real, tendían a reinterpretar esos indicios para mantener su juicio inicial. La segunda es la imprudencia, es decir, la disposición a emprender acciones dañinas con tal de completar una tarea de alcance muy acotado. El informe plantea un criterio de comparación directo: un modelo bien alineado, ante esta situación, debería detenerse o decirle al humano que «la tarea no se puede completar tal como se pide».
El informe lleva esta atribución un paso más allá y sugiere que el reward hacking, ampliamente presente en los entornos de producción, podría ser precisamente el origen de que los modelos estén dispuestos a ejecutar largas cadenas de acciones potencialmente dañinas en el mundo real. Este hilo remite a dos medidas internas de principios de año: en febrero, la compañía revirtió tres días de entrenamiento por refuerzo de Mythos Preview tras detectar reward hacking; en abril se congelaron durante alrededor de un mes todos los cambios en los entornos de RL de producción para una revisión integral. Según el informe, esa inversión de primavera en monitorizar y contener el reward hacking es la razón principal de que los modelos de producción actuales sean menos propensos a mostrar comportamientos de búsqueda de recompensa más peligrosos.
Algunas cifras de la lista de reformas
Las medidas hechas públicas cubren cuatro áreas: entornos de evaluación y entrenamiento, entornos de RL, normas para socios externos e infraestructura interna.
En el lado de la evaluación, Anthropic ha desplegado clasificadores automáticos que identifican en tiempo real los intentos de un modelo de escapar del sandbox o acceder a Internet de forma inesperada, realiza auditorías automatizadas de sandbox sobre los registros de evaluación recientes, ha migrado los sandboxes de red de mayor riesgo a entornos con aislamiento más fuerte, y hace que los propios modelos intenten escapar para poner a prueba, en modo red team, la pila de virtualización. Para entrenar clasificadores capaces de reconocer comportamientos desalineados, la compañía entrenó deliberadamente modelos desalineados en 80 entornos de RL reales distintos. Los resultados de las auditorías no fueron nada halagüeños: más del 10% de los entornos de producción quedaron señalados por diversos problemas.
Los cambios en la infraestructura interna se parecen más a la ingeniería de seguridad tradicional: se eliminó un lote de cuentas de personal y automatizadas con acceso a los pesos de los modelos y a los datos de clientes, el tráfico saliente de los clústeres de cómputo pasa a bloquearse por defecto en su totalidad, los servicios internos deben autenticarse mutuamente antes de comunicarse, y se han retirado configuraciones heredadas y servicios compartidos.
Para los socios externos de evaluación, Anthropic fija cuatro normas: las evaluaciones cibernéticas no tienen acceso a Internet por defecto, y las claves de API se mantienen fuera del sandbox; antes de arrancar, el modelo debe primero sondear el sandbox en busca de vulnerabilidades y confirmar que la tarea es resoluble; los prompts deben delimitar con claridad los comportamientos permitidos y prohibidos; y el razonamiento, las acciones y la actividad de red del modelo deben monitorizarse en tiempo real.
Un informe que no fue fácil de escribir
El traslado de 150 ingenieros de producto es la señal más contundente de este informe. Parchear una sola vulnerabilidad no requiere un movimiento de esta magnitud: a grandes rasgos, equivale a trasladar en bloque un equipo de producto entero hacia seguridad, fiabilidad y privacidad.
Anthropic se ha situado este año, de forma constante, en el lado más cauteloso del relato sobre seguridad: ha publicado su manual interno de desarrollo, ha pedido una desaceleración del sector y ha admitido que Claude «se guarda» capacidad al investigar IA de frontera. La diferencia esta vez es que los episodios anteriores hablaban de riesgos en las capacidades del modelo, mientras que este habla de un agujero en su propia cadena de evaluación, un agujero abierto dentro de un entorno de un tercero. Para los terceros que se dedican a evaluar modelos, las cuatro normas del final del informe se leen más como un nuevo listón de entrada; para el resto del sector, este documento que abre los procesos internos a la vista externa probablemente tenga más valor de referencia que para los propios usuarios.
Fuentes: informe oficial de Anthropic sobre mejoras de seguridad y alineación, AI Security Institute del Reino Unido, CocoLoop; el informe original verifica tres cifras: el número de ingenieros reasignados, el número de entornos de RL y el porcentaje de entornos de producción señalados.