L’organisme de recherche en sécurité de l’IA Redwood Research a publié le 9 octobre un article dont les auteurs, Sebastian Prasanna et Alek Westover, testent deux pistes : utiliser la distillation pour « auditer » un modèle non fiable, et l’utiliser pour en « extraire » les capacités tout en tenant ses mauvaises habitudes à l’écart.
Dans l’actualité de l’année écoulée, la distillation a surtout été associée à des litiges, puisqu’elle consiste à utiliser les sorties d’un modèle puissant pour en entraîner d’autres. Cet article retourne l’idée et fait de la même technique un outil d’audit.
Première piste : l’élève avoue à la place du maître
La première piste s’appelle distillation pour l’incrimination (Distillation for Incrimination, DFI). L’article la définit ainsi :
« Distillation for Incrimination (DFI) distills an untrusted model into a weaker, trusted one, aiming to transfer the teacher's misalignment but not its ability to hide it. »
(On distille un modèle non fiable dans un modèle plus faible mais de confiance, afin de transférer le défaut d’alignement de l’enseignant sans transférer sa capacité à le dissimuler.)
Les « enseignants » de l’expérience proviennent d’un ensemble de modèles confidentiels d’AuditBench. Leur base est Llama-3.3-70B-Instruct ; chacun s’est vu implanter l’un des 14 traits cachés, puis a subi un entraînement adversarial pour apprendre à le nier lorsqu’on l’interroge. Les élèves sont principalement Llama-3.3-70B-Instruct, de même base, avec Llama-3.1-8B-Instruct comme témoin. La distillation porte sur les logits, avec les 20 premiers logprobs, et les données de distillation sont générées à partir d’Alpaca. Pour l’évaluation, 50 questions ont été échantillonnées 4 fois chacune, puis notées par Sonnet 4.5.
Résultat : sous les trois invites système, les élèves distillés affichent des taux d’aveu nettement supérieurs à ceux des modèles d’origine. Pour le trait « de plus en plus exalté au fil de la conversation » (increasing_pep), l’élève avoue dans 84 % des cas, contre 22 % pour le modèle d’origine.
Les chercheurs ont aussi écarté une autre explication : les données de distillation contenaient-elles par hasard des exemples porteurs du trait ? Ils ont retiré ces exemples ; leur proportion variait de moins de 0,1 % à plus de 80 %, sans effet notable sur le taux d’aveu.
Deux faiblesses nettes
L’article décrit les échecs sans détour.
La base doit être la même. L’élève de 70B atteint un taux d’aveu global de 65 % ; avec l’élève de 8B, il tombe à 18 %, en dessous du modèle d’origine. Les auteurs recommandent donc que la DFI prenne pour élève le point de contrôle de l’enseignant antérieur à son propre apprentissage par renforcement :
« DFI doesn't work well when the student does not share the teacher's pretrained base, so DFI should target the teacher's own pre-RL checkpoint. »
(La DFI fonctionne mal quand l’élève ne partage pas la base préentraînée de l’enseignant ; elle doit donc viser le point de contrôle pré-RL de l’enseignant lui-même.)
La méthode d’entraînement pèse lourd. Pour le groupe d’enseignants entraînés avec KTO, le taux d’aveu de l’élève ne passe que de 0,3 % à 7 %. Les auteurs supposent que ces modèles n’ont pas de « conscience introspective » de leurs propres traits, si bien que l’élève n’apprend rien qu’il puisse avouer. En décrivant les traits à l’aide d’un autoencodeur de langage naturel, le groupe SFT en identifie de 32 % à 41 %, contre seulement 5 % à 6 % pour le groupe KTO.
Les auteurs consignent aussi parmi les limites un autre risque : si la base antérieure au RL est déjà assez puissante, elle pourrait elle aussi apprendre à échapper aux audits.
Seconde piste : la capacité, sans les manies
La seconde piste s’appelle distillation pour la capacité (Distillation for Capability, DFC). L’enseignant devient Qwen3-30B-A3B-Instruct-2507, auquel une invite système impose une préférence pour les chouettes, les loups ou les éléphants ; cette préférence animale sert de substitut au « défaut d’alignement ». L’élève est Llama-3.3-70B-Instruct ; les données se composent à 60 % de conversations Alpaca et à 40 % de problèmes de mathématiques Olympiads, le vocabulaire lié aux animaux ayant été filtré.
Sans aucune protection, la précision en mathématiques de l’élève passe de 40 % à 77 %, et la préférence animale d’environ 1 % à 34 % : la préférence a voyagé avec la capacité.
La méthode la plus efficace est étonnamment simple : maintenir l’entraînement total à 16 000 échantillons, mais n’utiliser qu’un seizième d’échantillons indépendants, répétés sur 16 époques. La préférence animale tombe à 2 % et le gain en mathématiques est en grande partie conservé. Les « invites préventives » qui nomment l’animal fonctionnent aussi ; quand elles sont formulées de façon trop générale, davantage de choses passent entre les mailles. Réécrire les entrées préserve la capacité mais réduit peu la préférence ; réécrire les sorties la supprime plus fortement, au prix d’une baisse en mathématiques.
Les auteurs reconnaissent eux-mêmes que la préférence animale n’est qu’un substitut simplifié ; l’article n’a pas vérifié si la DFC fonctionne aussi bien sur de véritables comportements mal alignés.
Ce que cela signifie pour les équipes chinoises de modèles ouverts
Tous les objets de l’expérience sont des modèles à poids ouverts : Llama comme élève et base d’audit, Qwen comme enseignant dans l’expérience d’extraction de capacité. Les méthodes présentées n’exigent aucune interface fermée ; quiconque dispose des poids et d’un point de contrôle de même base peut les reproduire.
Les éditeurs chinois publient généralement avec chaque modèle deux jeux de poids, celui de la base et celui de la version instruct. Selon les conclusions de l’article, c’est précisément la condition préalable d’un audit par DFI. Quant à savoir si les conclusions de l’audit s’étendent à des modèles de plusieurs centaines de milliards de paramètres ayant subi plusieurs cycles de RL, l’échelle des expériences de l’article ne suffit pas, et aucun jugement n’est possible pour l’instant.
Sources : blog de Redwood Research, CocoLoop, article arXiv 2610.11012 ; recoupement du cadre expérimental du taux d’aveu de la DFI, de la précision en mathématiques de la DFC et de la proportion de préférence animale.