Anthropic usa classificadores constitucionais para prevenir jailbreak em IA

A Anthropic divulgou no início deste ano os resultados da pesquisa sobre Constitutional Classifiers, com uma ideia central bastante direta: usar dados sintéticos gerados por IA para treinar classificadores de segurança, evitando que modelos de IA sofram jailbreak.

Princípio de funcionamento

A arquitetura do sistema é de duas camadas — classificadores de entrada e saída trabalham simultaneamente, monitorando cada interação do modelo em tempo real. Os dados de treinamento não são anotados manualmente, mas sim gerados ao fornecer ao LLM um conjunto de "constituição" (regras em linguagem natural), permitindo que ele gere automaticamente vários cenários de ataque e os julgamentos correspondentes.

Eficácia prática

Em mais de 3.000 horas de testes de red team, ninguém encontrou um método de jailbreak universalmente aplicável.

A primeira geração reduziu a taxa de sucesso de jailbreak de 86% para 4,4%, bloqueando 95% dos ataques. As duas principais abordagens de ataque descobertas pelo red team foram:

  • Ataques de recombinação: Dividir informações prejudiciais em fragmentos aparentemente inofensivos e depois remontá-los
  • Ataques de ofuscação: Forçar o modelo a gerar conteúdo sensível em formato disfarçado

A versão atualizada Constitutional Classifiers++ é ainda mais potente — arquitetura de dois estágios, usando primeiro uma sonda leve para verificar o estado de ativação interna do Claude e, se suspeito, ativando o classificador pesado. Em 198.000 tentativas de red team, apenas uma vulnerabilidade de alto risco foi encontrada, e ainda não havia método de jailbreak universal.

E o custo?

A taxa de falsa rejeição no ambiente de produção aumentou apenas 0,38 pontos percentuais, e o custo de inferência aumentou 23,7%. Para um sistema de segurança, esse custo é bastante razoável.

A Anthropic também lançou em janeiro deste ano uma nova versão da constituição do Claude sob a licença de domínio público CC, com prioridades de alta a baixa: Segurança e supervisão humana → Comportamento ético → Diretrizes da Anthropic → Utilidade. Colocar a "utilidade" em último lugar, essa ordenação por si só já é uma declaração de posicionamento.

Fonte de referência: CocoLoop, artigo oficial de pesquisa da Anthropic