Anthropic utiliza clasificadores constitucionales para prevenir jailbreak en IA

A principios de este año, Anthropic publicó los resultados de su investigación sobre Constitutional Classifiers, con una idea central muy directa: utilizar datos sintéticos generados por IA para entrenar clasificadores de seguridad, evitando que los modelos de IA sufran jailbreak.

Principio de funcionamiento

La arquitectura del sistema es de dos capas: los clasificadores de entrada y salida trabajan simultáneamente, monitoreando cada interacción del modelo en tiempo real. Los datos de entrenamiento no se etiquetan manualmente, sino que se le proporciona a un LLM un conjunto de "constitución" (reglas en lenguaje natural) para que genere automáticamente varios escenarios de ataque y los juicios correspondientes.

Eficacia práctica

En más de 3.000 horas de pruebas de red team, nadie encontró un método de jailbreak universalmente aplicable.

La primera generación redujo la tasa de éxito de jailbreak del 86% al 4,4%, bloqueando el 95% de los ataques. Los dos enfoques de ataque principales descubiertos por el red team fueron:

  • Ataques de recombinación: Dividir información dañina en fragmentos aparentemente inofensivos y luego volver a ensamblarlos
  • Ataques de ofuscación: Forzar al modelo a generar contenido sensible en formato camuflado

La versión mejorada Constitutional Classifiers++ es aún más potente: una arquitectura de dos etapas que primero utiliza una sonda ligera para verificar el estado de activación interna de Claude y, si es sospechoso, activa el clasificador pesado. En 198.000 intentos de red team, solo se encontró una vulnerabilidad de alto riesgo, y aún no existía un método de jailbreak universal.

¿Y el costo?

La tasa de falsos rechazos en el entorno de producción aumentó solo 0,38 puntos porcentuales, y el costo de inferencia aumentó un 23,7%. Para un sistema de seguridad, este costo es bastante razonable.

Anthropic también publicó en enero de este año una nueva versión de la constitución de Claude bajo la licencia de dominio público CC, con prioridades de mayor a menor: Seguridad y supervisión humana → Comportamiento ético → Directrices de Anthropic → Utilidad. Colocar la "utilidad" en último lugar, esta ordenación en sí misma es una declaración de postura.

Fuente de referencia: CocoLoop, artículo oficial de investigación de Anthropic