Redwood, 증류로 모델 감사…자백률 22%에서 84%로

AI 안전 연구기관 Redwood Research가 10월 9일 논문을 공개했다. 저자 Sebastian Prasanna와 Alek Westover는 두 가지 아이디어를 실험으로 검증했다. 하나는 증류로 신뢰할 수 없는 모델을 '감사'하는 것이고, 다른 하나는 증류로 그 모델의 능력만 '뽑아내고' 나쁜 습관은 밖에 두는 것이다.

지난 1년 남짓 증류는 주로 분쟁과 엮여 보도됐다. 강한 모델의 출력으로 다른 모델을 훈련하는 방식을 가리키는 말이다. 이 논문은 같은 기술을 거꾸로 써서 감사 도구로 삼았다.

첫 번째 노선: 학생이 교사 대신 자백하게 한다

첫 번째 노선은 증류를 통한 입증(Distillation for Incrimination, DFI)이다. 논문은 다음과 같이 정의한다.

"Distillation for Incrimination (DFI) distills an untrusted model into a weaker, trusted one, aiming to transfer the teacher's misalignment but not its ability to hide it."

(신뢰할 수 없는 모델을 더 약하고 신뢰할 수 있는 모델로 증류해, 교사의 정렬 이탈 성향은 전달하되 그것을 숨기는 능력은 전달하지 않는 것이 목표다.)

실험의 '교사'는 AuditBench에 포함된 비공개 모델 묶음에서 가져왔으며, 기반은 모두 Llama-3.3-70B-Instruct다. 각 모델에는 14가지 숨은 특성 중 하나가 심어졌고, 적대적 훈련을 거쳐 질문을 받으면 부인하도록 학습했다. 학생은 주로 같은 기반인 Llama-3.3-70B-Instruct를 썼고, 비교용으로 Llama-3.1-8B-Instruct도 사용했다. 증류는 상위 20개 logprob을 취하는 logit 증류 방식이며, 증류 데이터는 Alpaca로 생성했다. 평가는 50개 질문을 문항당 4회 샘플링하고 Sonnet 4.5가 채점했다.

결과는 세 가지 시스템 프롬프트 모두에서 증류된 학생의 자백률이 원래 모델보다 뚜렷하게 높았다. 대화가 이어질수록 점점 들뜨는 특성(increasing_pep)의 경우 학생의 자백률은 84%, 원래 모델은 22%였다.

연구진은 다른 해석도 배제했다. 증류 데이터에 우연히 특성이 담긴 샘플이 섞여 들어간 것은 아닐까 하는 의문이다. 이런 샘플을 삭제하고 특성 포함 샘플의 비율을 0.1% 미만에서 80% 이상까지 바꿔 봤지만, 자백률에는 뚜렷한 변화가 없었다.

뚜렷한 두 가지 약점

논문은 실패 사례도 솔직하게 적었다.

기반이 같아야 한다. 70B 학생의 전체 자백률은 65%였지만, 8B 학생으로 바꾸면 18%에 그쳐 원래 모델보다도 낮았다. 이에 저자들은 DFI가 교사 자신의 강화학습 이전 체크포인트를 학생으로 삼아야 한다고 제안한다.

"DFI doesn't work well when the student does not share the teacher's pretrained base, so DFI should target the teacher's own pre-RL checkpoint."

(학생이 교사의 사전 학습 기반을 공유하지 않으면 DFI는 잘 작동하지 않으므로, DFI는 교사 자신의 RL 이전 체크포인트를 대상으로 해야 한다.)

훈련 방식의 영향이 크다. KTO로 훈련한 교사 그룹에서는 학생의 자백률이 0.3%에서 7%로 오르는 데 그쳤다. 저자들은 이런 모델이 자신의 특성에 대한 '내성적 인식'이 부족해 학생이 자백할 거리를 배우지 못한다고 추측한다. 자연어 오토인코더로 특성을 서술하게 했을 때 SFT 그룹은 32%에서 41%를 맞혔지만, KTO 그룹은 5%에서 6%뿐이었다.

저자들은 한계 항목에 또 다른 위험도 적었다. RL 이전의 기반이 이미 충분히 강하다면, 그 모델 역시 감사를 피하는 법을 학습할 수 있다는 점이다.

두 번째 노선: 능력만 얻고 괴벽은 막는다

두 번째 노선은 능력을 위한 증류(Distillation for Capability, DFC)다. 교사는 Qwen3-30B-A3B-Instruct-2507로 바꾸고, 시스템 프롬프트로 올빼미, 늑대, 코끼리 중 하나를 선호하게 했다. 이 동물 선호가 '정렬 이탈'의 대역 역할을 한다. 학생은 Llama-3.3-70B-Instruct이며, 데이터는 60%가 Alpaca 대화, 40%가 Olympiads 수학 문제이고 동물 관련 어휘는 걸러냈다.

아무 방어도 하지 않으면 학생의 수학 정확도는 40%에서 77%로 올랐고, 동물 선호도 약 1%에서 34%로 올랐다. 선호가 능력과 함께 넘어간 것이다.

가장 효과적인 방법은 의외로 단순했다. 총 훈련량은 1만 6000개 샘플로 고정하되, 고유 샘플은 16분의 1만 쓰고 16에폭 반복 훈련하는 것이다. 동물 선호는 2%로 떨어졌고 수학 향상은 대체로 유지됐다. 동물 이름을 명시한 '예방형 프롬프트'도 효과가 있었지만, 프롬프트가 두루뭉술하면 새는 부분이 많았다. 입력을 고쳐 쓰면 능력은 지켜지나 선호를 누르는 효과는 제한적이었다. 출력을 고쳐 쓰면 선호를 더 강하게 누르지만 수학 점수가 떨어지는 대가가 따랐다.

저자들도 동물 선호는 단순화한 대역일 뿐이며, DFC가 실제 정렬 이탈 행동에도 똑같이 통하는지는 논문에서 검증하지 않았다고 인정한다.

중국 오픈소스 모델 팀에 주는 시사점

이 논문의 실험 대상은 모두 오픈 웨이트다. Llama는 학생과 감사 기반으로, Qwen은 능력 추출 실험의 교사로 쓰였다. 제시된 방법은 비공개 API가 필요 없으며, 가중치와 같은 기반의 체크포인트만 있으면 재현할 수 있다.

중국 업체들은 모델을 낼 때 기반 버전과 지시 튜닝 버전 두 벌의 가중치를 함께 공개하는 경우가 많은데, 논문의 결론대로라면 이는 DFI 감사를 하기 위한 전제 조건에 그대로 해당한다. 다만 감사 결과를 수백 B 파라미터 규모에 여러 차례 RL을 거친 대형 모델로 확장할 수 있는지는 논문의 실험 규모가 미치지 못해 현재로서는 판단할 수 없다.

참고 출처: Redwood Research 블로그, CocoLoop, arXiv 논문 2610.11012. DFI 자백률, DFC 수학 정확도와 동물 선호 비율의 실험 조건을 확인했다.