Zhipu(智谱)는 8월 14일 GLM-5.3을 공개했고, 8월 18일을 전후해 API 제공을 정식으로 시작했다. 가격은 100만 입력 토큰당 1.40달러, 100만 출력 토큰당 4.40달러이며 컨텍스트 윈도우는 100만 토큰이다. 독립 평가 기관인 Artificial Analysis는 같은 날 지능 지수 점수로 60점을 부여했고, 자사가 집계하는 182개 모델 중 8위로 평가했다. 같은 가격대 추론 모델의 중앙값은 35점에 그친다.
이번 소식은 우선 점수, 그다음이 가격이라는 두 층위로 읽어야 한다. Artificial Analysis의 같은 라운드 데이터에서 오픈웨이트이거나 공개 API로 이용 가능한 여러 모델을 나란히 놓아 보면 다음과 같다. GLM-5.3은 최고 설정에서 59.5점(모델 페이지에는 반올림되어 60점으로 표시), 작업당 비용 0.68달러, 작업당 출력 토큰 41107개다. Kimi K3는 59.7점, 0.84달러, 25474토큰. Qwen 3.8 Max는 58.1점, 1.13달러, 38287토큰. xAI의 Grok 4.6(high)은 60.9점, 0.84달러, 21735토큰이다. 점수로 보면 GLM-5.3과 Kimi K3의 차이는 단 0.2점으로, 오픈웨이트 진영 최상위권에서 사실상 나란히 서 있다. 다만 GLM-5.3은 같은 작업을 처리하는 데 토큰을 약 60% 더 많이 쓰기 때문에 단가 우위가 그만큼 상쇄된다. 그럼에도 작업당 비용으로 보면 0.68달러는 이 그룹에서 가장 낮은 수치다.
공개 당일 Zhipu가 강조한 것은 코딩과 보안
8월 14일 발표 자료에서 Zhipu는 GLM-5.3을 GLM-5.2와 같은 베이스 모델 위에서 이뤄진 '극한의 사후 학습(post-training)' 결과물로 규정했다. 학습 환경과 시간을 대폭 늘렸을 뿐 베이스 모델 자체는 바꾸지 않았다는 설명이다. 공개한 성적표는 코딩과 에이전트 작업에 집중돼 있다. Terminal Bench 3.0은 GLM-5.2의 4.6에서 28.3으로, DeepSWE v1.1은 46.2에서 66.9로, Agents' Last Exam은 23.8에서 28.5로 각각 상승했다. Zhipu 자체의 Z.ai Code Bench(High)에서는 정확도 31.4%를 기록해, 자사가 제시한 Claude Opus의 29.5%를 웃돌았다고 밝혔다. 사내 평가에 따르면 코딩 능력은 GLM-5.2 대비 50% 향상됐다.
"GLM-5.3 is the open-source model with the strongest programming ability."
이는 Zhipu 스스로의 포지셔닝으로, 오픈소스 진영에서 코딩 능력이 가장 뛰어난 모델이라고 주장하는 것이다.
별도로 강조된 또 다른 역량은 사이버보안이다. Zhipu에 따르면 사후 학습 과정에서 '예상을 뛰어넘는' 창발적 보안 능력이 나타났고, 레드팀 테스트 단계에서 누적 2436건의 취약점을 발견했다. CyberGym에서는 84.5%를 기록해 Anthropic의 Mythos 5(83.8%)와 비슷한 수준이었다. 반면 ExploitBench에서는 54.4%로, Mythos 5의 78.0%보다 뚜렷이 낮았다. 공식 설명에 따르면 커버 범위는 소프트웨어를 넘어 인터넷 프로토콜과 로봇 시스템까지 확장된다.
가중치는 2주 안에 공개, 코딩 도구가 먼저 접근
오픈소스 일정은 이렇다. 공개 후 2주 이내(8월 28일 전후로 예상)에 Hugging Face에 가중치를 공개하되, 안전성 평가와 보강 작업 완료가 전제 조건이다. 라이선스 조건은 아직 발표되지 않았다. 그 전까지는 API와 일부 코딩 도구를 통해서만 모델을 이용할 수 있다. Zhipu가 언급한 연동처는 자사의 ZCode, AutoClaw와 함께 TraeWork, WorkBuddy, Qoder, CatPaw 등 서드파티 코딩 플랫폼이다.
Hacker News에서 벌어진 Artificial Analysis 데이터 관련 논의는 사용자 관점의 보충 정보를 제공한다. 일부 개발자는 GLM-5.3의 추론 토큰이 눈에 보인다는 점을 장점으로 꼽으며 "모델이 궤도를 벗어날 때 제때 멈출 수 있다"고 말했다. 반면 토큰 사용량이 Kimi K3보다 많다고 직접 지적하는 목소리도 있었다. 토큰 단위로 과금되는 팀 입장에서는 1.4달러/4.4달러라는 단가에 더 긴 출력량을 곱해서 비교해야 하며, 가격표만 봐서는 실제 비용을 오판할 수 있다.
중국 개발자에게 남는 셈법
이번 가격 책정을 중국산 모델의 가격 흐름 속에 놓고 보면, GLM-5.2 출시 당시 Zhipu는 코딩 점수가 폐쇄형 모델에 근접하면서도 가격은 GPT-5.5의 6분의 1에 불과하다고 내세웠다. GLM-5.3은 절대 점수를 한 단계 더 끌어올리면서도 단가는 같은 수준을 유지하고 있다. 중국 내 이용자에게 실제 비교 대상은 DeepSeek V4 Pro와 Kimi K3의 API 가격, 그리고 각사가 제공하는 피크·비피크 할인이다. GLM-5.3은 점수 면에서 이미 이 경쟁 구도에 들어섰으며, 가격 전쟁이 뒤따를지는 2주 후 가중치 공개와 서드파티 추론 플랫폼 진입 이후의 가격 책정에 달려 있다.
참고 출처: Zhipu GLM-5.3 공개 자료, Artificial Analysis 모델 페이지, CocoLoop, Hacker News 논의, VentureBeat; API 입출력 가격, 지능 지수 점수와 순위, 작업당 비용 및 출력 토큰 수치(Artificial Analysis의 통일된 평가 환경), 공식 벤치마크 수치, 가중치 공개 일정을 확인했다.