A organização de pesquisa em segurança de IA Redwood Research publicou em 9 de outubro um artigo cujos autores, Sebastian Prasanna e Alek Westover, testam duas ideias: usar a destilação para "auditar" um modelo não confiável e usá-la para "extrair" a capacidade dele, mantendo os maus hábitos do lado de fora.
Nas notícias do último ano e pouco, a destilação esteve quase sempre ligada a disputas, já que significa usar as saídas de um modelo forte para treinar outros. O artigo inverte essa lógica e transforma a mesma técnica em ferramenta de auditoria.
Primeira linha: o aluno confessa pelo professor
A primeira abordagem chama-se Destilação para Incriminação (Distillation for Incrimination, DFI). O artigo a define assim:
"Distillation for Incrimination (DFI) distills an untrusted model into a weaker, trusted one, aiming to transfer the teacher's misalignment but not its ability to hide it."
(Destila-se um modelo não confiável em outro, mais fraco e confiável, com o objetivo de transferir o desalinhamento do professor, mas não a sua capacidade de escondê-lo.)
Os "professores" do experimento vêm de um conjunto de modelos confidenciais do AuditBench. A base é o Llama-3.3-70B-Instruct; cada um recebeu um dos 14 traços ocultos e passou por treinamento adversarial para aprender a negá-lo quando questionado. Os alunos foram principalmente o Llama-3.3-70B-Instruct, com a mesma base, e, como controle, o Llama-3.1-8B-Instruct. A destilação foi de logits, com os 20 principais logprobs, e os dados de destilação foram gerados a partir do Alpaca. Na avaliação, foram 50 perguntas com 4 amostras cada, pontuadas pelo Sonnet 4.5.
O resultado: sob os três prompts de sistema, os alunos destilados tiveram taxas de confissão claramente superiores às dos modelos originais. No traço de "ficar cada vez mais animado ao conversar" (increasing_pep), o aluno confessou em 84% dos casos, contra 22% do modelo original.
Os pesquisadores também descartaram uma explicação alternativa: seria apenas porque os dados de destilação continham, por acaso, amostras com o traço? Eles removeram essas amostras; a proporção de amostras com o traço variou de menos de 0,1% a mais de 80%, sem mudança significativa na taxa de confissão.
Duas limitações evidentes
O artigo é bastante direto ao descrever os casos de falha.
A base precisa ser a mesma. O aluno de 70B teve taxa geral de confissão de 65%; com o aluno de 8B, apenas 18%, abaixo do modelo original. Por isso, os autores recomendam que a DFI use como aluno o checkpoint do próprio professor anterior ao aprendizado por reforço:
"DFI doesn't work well when the student does not share the teacher's pretrained base, so DFI should target the teacher's own pre-RL checkpoint."
(A DFI não funciona bem quando o aluno não compartilha a base pré-treinada do professor, então a DFI deve ter como alvo o checkpoint do próprio professor antes do RL.)
O método de treinamento pesa muito. No grupo de professores treinados com KTO, a taxa de confissão do aluno subiu apenas de 0,3% para 7%. Os autores supõem que esse tipo de modelo carece de "consciência introspectiva" sobre seus próprios traços, de modo que o aluno não aprende nada que possa confessar. Ao descrever os traços com um autoencoder de linguagem natural, o grupo SFT acertou de 32% a 41%, enquanto o grupo KTO acertou só de 5% a 6%.
Os autores registram ainda, nas limitações, outro risco: se a base anterior ao RL já for forte o bastante, ela também pode aprender a escapar das auditorias.
Segunda linha: só a capacidade, sem as manias
A segunda abordagem chama-se Destilação para Capacidade (Distillation for Capability, DFC). O professor passa a ser o Qwen3-30B-A3B-Instruct-2507, que recebe via prompt de sistema uma preferência por corujas, lobos ou elefantes; essa preferência por animais faz o papel de substituta do "desalinhamento". O aluno é o Llama-3.3-70B-Instruct; os dados são 60% de conversas do Alpaca e 40% de problemas de matemática do Olympiads, com o vocabulário relacionado a animais já filtrado.
Sem nenhuma proteção, a precisão em matemática do aluno subiu de 40% para 77%, e a preferência por animais subiu de cerca de 1% para 34%: a preferência foi transmitida junto com a capacidade.
O método mais eficaz é surpreendentemente simples: manter o treinamento total em 16 mil amostras, mas usar apenas um dezesseis avos de amostras independentes, repetidas por 16 épocas. A preferência por animais caiu para 2%, e o ganho em matemática foi em grande parte preservado. Os "prompts preventivos" que citam o animal pelo nome também funcionam; quando o prompt é genérico, escapa mais. Reescrever as entradas preserva a capacidade, mas reduz pouco a preferência; reescrever as saídas suprime a preferência com mais força, ao custo de perder pontos em matemática.
Os próprios autores admitem que a preferência por animais é apenas um substituto simplificado, e o artigo não verificou se a DFC funciona da mesma forma com comportamentos desalinhados reais.
O que isso significa para as equipes chinesas de modelos abertos
Todos os objetos do experimento têm pesos abertos: o Llama como aluno e base de auditoria, o Qwen como professor no experimento de extração de capacidade. As técnicas apresentadas não exigem uma interface fechada; quem tem os pesos e um checkpoint com a mesma base consegue reproduzi-las.
As fabricantes chinesas costumam divulgar, ao lançar um modelo, dois conjuntos de pesos: o da base e o da versão instruct. Segundo as conclusões do artigo, essa é justamente a condição necessária para uma auditoria por DFI. Quanto a saber se os resultados da auditoria se estendem a modelos de centenas de bilhões de parâmetros e várias rodadas de RL, a escala dos experimentos do artigo não basta, e por ora não é possível chegar a um veredito.
Fontes: blog da Redwood Research, CocoLoop, artigo arXiv 2610.11012; conferidos os critérios experimentais da taxa de confissão da DFI, da precisão em matemática da DFC e da proporção de preferência por animais.