Anthropic은 올해 초 Constitutional Classifiers 연구 결과를 발표했습니다. 핵심 아이디어는 간단합니다. AI가 생성한 합성 데이터를 사용해 안전 분류기를 훈련시켜 AI 모델이 탈옥되는 것을 방지하는 것입니다.
작동 원리
시스템 아키텍처는 이중 계층으로, 입력 분류기와 출력 분류기가 동시에 작동하여 모델과의 모든 상호작용을 실시간으로 모니터링합니다. 훈련 데이터는 수동으로 레이블링되지 않습니다. 대신 LLM에 "헌법"(자연어 규칙)을 제공하여 다양한 공격 시나리오와 이에 대한 판단을 자동으로 생성하도록 합니다.
실전 효과
3,000시간 이상의 레드팀 테스트에서 보편적인 탈옥 방법을 찾은 사람은 아무도 없었습니다.
1세대는 탈옥 성공률을 86%에서 4.4%로 낮추고 공격의 95%를 차단했습니다. 레드팀이 발견한 두 가지 주요 공격 방식은 다음과 같습니다:
- 재구성 공격: 유해한 정보를 겉보기에 무해한 조각으로 분해한 후 다시 조합
- 난독화 공격: 모델이 위장된 형식으로 민감한 콘텐츠를 출력하도록 유도
업그레이드된 Constitutional Classifiers++는 더욱 강력합니다. 2단계 아키텍처로, 먼저 경량 프로브로 Claude의 내부 활성화 상태를 확인하고 의심스러운 활동이 감지되면 본격적인 분류기를 가동합니다. 19만 8,000회의 레드팀 시도 중 고위험 취약점은 단 1건만 발견되었으며, 여전히 보편적인 탈옥 방법은 없었습니다.
비용은?
프로덕션 환경에서 오거부율은 0.38%포인트만 증가했으며, 추론 오버헤드는 23.7% 증가했습니다. 보안 시스템으로서는 상당히 합리적인 비용입니다.
Anthropic은 또한 올해 1월 CC 퍼블릭 도메인 라이선스로 Claude의 새 버전 헌법을 공개했습니다. 우선순위는 높은 것부터 안전 및 인간 감독 → 윤리적 행동 → Anthropic 가이드라인 → 유용성 순입니다. "유용성"을 최하위에 배치한 이 순서 자체가 하나의 입장 표명입니다.
출처: CocoLoop, Anthropic Research 공식 논문