Anthropic, GLM-5.3 안전장치 뚫려

Anthropic은 9월 29일 즈푸(Zhipu)의 GLM-5.3에 대한 사이버 공격 능력을 평가한 연구 보고서를 발표했다. 결론은 이 오픈웨이트 모델이 이미 엔드투엔드로 취약점 공격 코드를 자율적으로 만들어낼 수 있는 수준이며, Anthropic 자체 모델인 Claude Mythos Preview에 근접한다는 것, 그리고 이 모델의 안전장치는 비교적 단순한 방법으로 우회할 수 있다는 것이다.

보고서는 다음과 같이 밝혔다.

"GLM-5.3 will likely give malicious actors access to capabilities that will allow them to find and exploit cyber vulnerabilities without meaningful restrictions."

어떤 공격 능력을 테스트했나

Anthropic은 세 가지 테스트를 진행했다. 첫 번째는 크롬 V8 엔진 취약점을 겨냥한 ExploitBench로, GLM-5.3은 410회 시도 중 50회 성공해 성공률 약 12%를 기록했고 Mythos Preview는 14%였다. 두 번째는 OSS-Fuzz 프로젝트를 기반으로 한 자체 바이너리 취약점 공격 테스트로, GLM-5.3은 4%, Mythos Preview는 6%였으며, 비교 대상인 Claude Opus 4.6, Kimi K3, DeepSeek V4.1-Flash, 이전 세대 GLM-5.2는 모두 0%였다. 세 번째는 인간 전문가가 참여하는 개방형 공격 과제였다.

진입 장벽이 얼마나 낮아졌는지 가장 잘 보여주는 것은 실제 CVE를 재현한 사례다. 사람이 투입한 시간은 약 20분에 불과했고, GLM-5.3-Flash가 8시간 동안 스스로 작업해 즈푸의 API 요금 기준 약 20.40달러에 실제로 쓸 수 있는 공격 코드를 만들어냈다. 모든 코드는 격리된 샌드박스 안에서 실행됐으며 외부 시스템에는 접근하지 않았다.

안전장치는 어디까지 막아내나

악성 요청을 곧바로 제시하면 GLM-5.3의 거부율은 약 95%이고 모의 공격 성공률은 0이다. 하지만 다음과 같은 방식을 쓰면 상황이 달라진다.

방법우회 성공률
그럴듯한 구실 지어내기64%
추론 과정을 미리 채워 넣기92%
"어블레이션"으로 거부 메커니즘 제거100%

어블레이션은 모델 가중치 자체를 수정해야 하는 작업으로, 오픈웨이트 모델에서만 가능하다. Anthropic에 따르면 팀이 이 작업을 한 것은 이번이 처음이었으며, 약 2200 GPU시간과 4400달러 상당의 비용이 들었고, 처리 후 거부율은 95%에서 3~14%로 떨어졌다. 대조군으로 안전장치가 적용된 Claude 모델은 같은 테스트에서 뚫리지 않았다.

보고서는 세 가지를 제안한다. 방어 측에도 동등하거나 더 강력한 프런티어 모델에 대한 접근권을 줄 것, 정부가 고성능 모델에 대해 안전성 테스트를 실시할 것, 오픈웨이트 모델 개발사가 그에 상응하는 안전장치를 추가할 것이다. 이 보고서에 대한 즈푸 측의 공식 반응은 확인되지 않았다.

다른 평가는 다소 다른 수치를 내놓았다

미국 상무부 산하 CAISI(AI 표준·혁신 센터)도 9월 17일 GLM-5.3의 사이버 능력에 대한 자체 평가를 발표한 바 있다. 이 평가의 결론은 GLM-5.3이 현재 사이버 능력이 가장 뛰어난 오픈웨이트 모델이지만 미국 프런티어 모델에는 뚜렷이 못 미치며, 종합적으로 약 4개월의 격차가 있다는 것이다.

두 보고서의 수치는 크게 엇갈린다. CAISI 버전의 ExploitBench에서 GLM-5.3은 61.1%, 미국 최고 프런티어 모델은 100%, 이전까지 최고였던 중국 모델은 32.2%였다. SEC-Bench Pro에서는 40.4% 대 90.2%였다. Anthropic이 제시한 12%는 자체 테스트 구성에서 나온 수치라 두 결과를 직접 비교할 수는 없다.

순위에 대해서는 두 보고서 모두 일치한다. GLM-5.3은 오픈웨이트 진영에서는 선두지만 미국의 가장 강력한 폐쇄형 모델에는 아직 못 미친다는 것이다. 다만 이 격차를 어떻게 볼지에 대해서는 시각이 갈린다. CAISI는 "아직 4개월 격차가 있다"는 점을 강조하는 반면, Anthropic은 이런 능력이 이미 누구나 내려받아 개조할 수 있는 상태이며 안전장치가 이를 제약하지 못한다는 점을 강조한다.

중국 개발사와 기업 입장에서 이 보고서의 직접적인 영향은 아마도 해외 유통 채널에서 나타날 가능성이 크다. GLM-5.3은 그동안 해외 API 배포·호스팅 플랫폼에 비교적 폭넓게 올라와 있었다. 더 많은 미국 기관이 Anthropic의 이런 판단을 따른다면, 해외 클라우드 플랫폼과 기업 고객이 중국산 오픈웨이트 모델의 입점 심사를 강화할 가능성이 있다. 다만 이는 아직 추측 단계로, 각 플랫폼은 아직 별다른 조치를 취하지 않았다.

참고 출처: Anthropic 연구 보고서, CocoLoop, 미국 NIST 산하 CAISI 평가 발표; ExploitBench 성공 횟수, 우회 성공률과 어블레이션 비용은 Anthropic 보고서 기준을 따르며 CAISI 수치는 자체 테스트 구성을 기준으로 한다.