Redwood audita modelos con destilación y la tasa de confesión sube al 84 %

La organización de investigación en seguridad de IA Redwood Research publicó el 9 de octubre un artículo cuyos autores, Sebastian Prasanna y Alek Westover, ponen a prueba dos ideas: usar la destilación para «auditar» un modelo no fiable, y usarla para «extraer» su capacidad manteniendo fuera los malos hábitos.

En las noticias del último año largo, la destilación ha estado casi siempre ligada a disputas, porque consiste en usar las salidas de un modelo potente para entrenar otros. Este artículo da la vuelta a esa idea y convierte la misma técnica en una herramienta de auditoría.

Primera vía: que el alumno confiese por el profesor

La primera vía se llama destilación para la incriminación (Distillation for Incrimination, DFI). El artículo la define así:

"Distillation for Incrimination (DFI) distills an untrusted model into a weaker, trusted one, aiming to transfer the teacher's misalignment but not its ability to hide it."

(Se destila un modelo no fiable en otro más débil y de confianza, con el objetivo de transferir la desalineación del profesor, pero no su capacidad para ocultarla.)

Los «profesores» del experimento proceden de un conjunto de modelos confidenciales de AuditBench. La base es Llama-3.3-70B-Instruct; a cada uno se le implantó uno de 14 rasgos ocultos y luego pasó por un entrenamiento adversarial para aprender a negarlo cuando se le pregunta. Los alumnos fueron principalmente Llama-3.3-70B-Instruct, con la misma base, y Llama-3.1-8B-Instruct como control. La destilación fue de logits, con los 20 logprobs principales, y los datos de destilación se generaron a partir de Alpaca. En la evaluación se usaron 50 preguntas con 4 muestras cada una, puntuadas por Sonnet 4.5.

El resultado: con los tres prompts de sistema, los alumnos destilados mostraron tasas de confesión claramente superiores a las del modelo original. Con el rasgo «cada vez más eufórico al conversar» (increasing_pep), el alumno confesó en el 84 % de los casos y el modelo original en el 22 %.

Los investigadores también descartaron otra explicación: ¿sería simplemente que los datos de destilación contenían, por casualidad, muestras con el rasgo? Eliminaron esas muestras; la proporción de muestras con el rasgo iba de menos del 0,1 % a más del 80 %, y la tasa de confesión no cambió de forma apreciable.

Dos puntos débiles evidentes

El artículo es muy franco al describir los casos de fracaso.

La base debe ser la misma. El alumno de 70B alcanzó una tasa de confesión global del 65 %; con el de 8B quedó en el 18 %, por debajo del modelo original. Por eso los autores sugieren que la DFI tome como alumno el punto de control del propio profesor previo al aprendizaje por refuerzo:

"DFI doesn't work well when the student does not share the teacher's pretrained base, so DFI should target the teacher's own pre-RL checkpoint."

(La DFI no funciona bien cuando el alumno no comparte la base preentrenada del profesor, así que debe apuntar al punto de control del propio profesor previo al RL.)

El método de entrenamiento influye mucho. En el grupo de profesores entrenados con KTO, la tasa de confesión del alumno solo subió del 0,3 % al 7 %. Los autores suponen que este tipo de modelos carece de «conciencia introspectiva» sobre sus propios rasgos, por lo que el alumno no aprende nada que pueda confesar. Al describir los rasgos con un autoencoder de lenguaje natural, el grupo SFT acertó entre el 32 % y el 41 %, y el grupo KTO solo entre el 5 % y el 6 %.

Los autores también recogen en las limitaciones otro riesgo: si la base previa al RL ya es lo bastante potente, también podría aprender a esquivar las auditorías.

Segunda vía: solo la capacidad, sin las manías

La segunda vía se llama destilación para la capacidad (Distillation for Capability, DFC). El profesor pasa a ser Qwen3-30B-A3B-Instruct-2507, al que se le indica mediante el prompt de sistema que prefiera los búhos, los lobos o los elefantes; esa preferencia por un animal hace de sustituto de la «desalineación». El alumno es Llama-3.3-70B-Instruct; los datos son un 60 % de conversaciones de Alpaca y un 40 % de problemas de matemáticas de Olympiads, con el vocabulario relacionado con animales ya filtrado.

Sin ninguna protección, la precisión en matemáticas del alumno subió del 40 % al 77 % y la preferencia por el animal pasó de alrededor del 1 % al 34 %: la preferencia se transmitió junto con la capacidad.

El método más eficaz es sorprendentemente sencillo: mantener el entrenamiento total en 16 000 muestras, pero usar solo una dieciseisava parte de muestras independientes y repetirlas durante 16 épocas. La preferencia por el animal bajó al 2 % y la mejora en matemáticas se conservó en lo esencial. Los «prompts preventivos» que nombran al animal también funcionan; si el prompt es genérico, se filtra más. Reescribir las entradas conserva la capacidad, pero reduce poco la preferencia; reescribir las salidas la suprime con más fuerza, a costa de perder puntos en matemáticas.

Los propios autores reconocen que la preferencia por un animal es solo un sustituto simplificado, y el artículo no verificó si la DFC funciona igual con comportamientos desalineados reales.

Qué significa para los equipos chinos de modelos abiertos

Todos los objetos del experimento son modelos de pesos abiertos: Llama como alumno y base de auditoría, y Qwen como profesor en el experimento de extracción de capacidad. Los métodos propuestos no necesitan una interfaz cerrada; quien tenga los pesos y un punto de control con la misma base puede reproducirlos.

Los fabricantes chinos suelen publicar con cada modelo dos juegos de pesos, el de la base y el de la versión instruct. Según las conclusiones del artículo, esa es justamente la condición previa para una auditoría con DFI. En cuanto a si los resultados de la auditoría se extienden a modelos de cientos de miles de millones de parámetros con varias rondas de RL, la escala de los experimentos del artículo no alcanza, y por ahora no es posible emitir un juicio.

Fuentes: blog de Redwood Research, CocoLoop, artículo de arXiv 2610.11012; se contrastaron los criterios experimentales de la tasa de confesión de la DFI, la precisión en matemáticas de la DFC y la proporción de preferencia por el animal.