지푸, GLM-5.3-플래시 오픈소스로 공개

8월 26일, 지푸는 OpenCode와 OpenRouter에서 일주일 넘게 익명으로 돌아가던 'Ox Alpha'의 정체를 공개했다. 정식 명칭은 GLM-5.3-Flash이며, 같은 날 가중치가 허깅페이스에 올라왔고 라이선스는 MIT를 채택했다.

GLM-5 시리즈 중 처음으로 네이티브 멀티모달을 지원하는 모델이다. 전체 파라미터는 3200억 개지만 토큰당 활성 파라미터는 180억 개에 불과하다. 레이어 수는 GLM-5.3의 92개에서 45개로 줄었고, 활성 파라미터도 이전 세대의 320억 개에서 180억 개로 낮아졌다. 절감된 연산 자원은 가격에 그대로 반영됐다. 공식 가격은 GLM-5.3의 약 10분의 1 수준이며, 한시적 할인 기간에는 다시 절반으로 떨어져 Claude Opus 4.8의 약 40분의 1 수준이 된다. Z.ai가 제시한 또 다른 수치로는, 할인가 기준 작업 하나를 완료하는 데 평균 0.045달러가 든다고 한다.

파라미터는 반토막, 점수는 그대로

Artificial Analysis의 Intelligence Index v4.1.1에서 GLM-5.3-Flash는 57점을 받아 세계 프런티어 모델 구간에 진입했다. 이는 앤스로픽의 현재 최고 인기 모델인 Opus 4.8과 같은 등급이다. 세부 항목별 편차는 더 크다. DeepSWE v1.1은 GLM-5.2의 46.2에서 63.4로 올랐고, Terminal-Bench 2.1은 84.3, Toolathlon Verified는 78.4, AutomationBench v1.0.6은 48.8을 기록했다. 지푸 자체 벤치마크인 Z.ai Code Bench 최고 난이도에서는 29.0점으로, Opus의 29.5점에 근접했다.

멀티모달은 이번 세대에 새로 추가된 부분이다. OfficeQA Pro는 62.4점, 툴 기반 추론을 포함한 CharXiv는 89.4점, 툴을 활용한 Chartography는 78.0점을 받았고, 영상 쪽에서는 MVBench가 77.8점, MMVU가 80.5점을 기록했다. 이 조합이 겨냥하는 지점은 "표와 차트를 읽을 줄 아는 업무용 에이전트"이지, 범용 이미지 이해 능력을 겨루는 벤치마크 쇼가 아니다.

아키텍처 측면에서는 스파스 어텐션과 선형 어텐션을 혼합한 최초의 오픈 프런티어 모델이며, IndexPool과 mHC(매니폴드 제약 하이퍼커넥션)도 새로 도입했다. 그 효과는 두 수치로 나타난다. GLM-5.3 대비 어텐션 연산량은 약 3분의 1(3.0배 감소)로, KV 캐시는 약 4분의 1(4.4배 감소)로 줄었다. 긴 컨텍스트에서 비용의 대부분을 차지하는 것이 KV 캐시인 만큼, 이 배율이 100만 토큰 창을 사양표상의 숫자가 아니라 실제로 쓸 수 있는 기능으로 만드는 관건이다.

추론 트래픽 전량을 자국산 칩으로 처리

익명 테스트 기간 동안 Ox Alpha는 한때 OpenCode에서 호출량이 가장 많은 모델이었다. 지푸에 따르면 이 기간의 추론 트래픽은 전량 자국산 AI 칩으로 처리됐으며, 엔드투엔드 서빙 성능은 이전 대비 3배 향상됐고 비용은 주류 엔비디아 GPU 구성과 맞먹는 수준까지 낮아졌다.

이 정보의 무게는 벤치마크 점수 못지않다. 지난 1년간 중국산 오픈소스 모델을 둘러싼 통상적인 서사는 "점수는 근접했지만 실제 배포는 여전히 H 시리즈 카드에 의존한다"는 것이었다. 추론 단에서 자국산 실리콘이 풀가동되고 단위 비용이 주류 GPU와 대등해지면, 모델 업체의 가격 전략은 더 이상 GPU 조달 가격에 발목 잡히지 않는다. GLM-5.3-Flash가 이전 세대의 10분의 1 가격을 감행할 수 있었던 자신감의 절반은 여기서 나온다.

대략 계산해보면, 한시 할인가 기준 입력 100만 토큰당 0.075달러, 출력 100만 토큰당 0.25달러일 때, 하루 평균 입력 5000만 토큰·출력 1000만 토큰을 소비하는 중형 에이전트 애플리케이션의 하루 모델 비용은 약 6.25달러다(캐시 할인과 재시도 비용은 제외한 개략치). 같은 호출량을 Opus 4.8에서 처리하면 비용 차이는 자릿수 단위로 벌어진다. 중국 내 에이전트 제품을 만드는 팀 입장에서는 "실제 서비스에 투입할 수 있는가"라는 질문이 예산 문제에서 다시 엔지니어링 문제로 돌아온 셈이다.

배포 측면에서는 SGLang, vLLM, KTransformers가 이미 지원하며, API도 docs.z.ai에 동시 공개됐다. 이번에 MIT 라이선스를 채택한 것은 이례적인 행보다. GLM 이전 세대는 대부분 자체 라이선스를 썼지만, MIT 라이선스에서는 상업적 재배포에 추가 조건이 거의 붙지 않아 해외 팀이 수정해 쓸 때 별도의 법무 검토를 다시 거칠 필요가 없다.

일주일 전 지푸는 이미 Ox Alpha가 자사의 반복 모델이라는 사실을 공개적으로 인정한 바 있으며, 당시 제시한 수치로는 호출량이 딥시크의 2배를 넘어섰다. 이제 이름, 가중치, 가격 세 가지가 모두 공개된 만큼, 남은 질문은 얼마나 많은 팀이 이를 "저렴한 테스트 모델"에서 "실제 운영 주력 모델"로 전환할 것이냐다.

참고 출처: Z.ai 공식 블로그, 허깅페이스 모델 페이지, CocoLoop, Artificial Analysis. 파라미터 규모, 벤치마크 점수, API 단가는 공식 발표 페이지 기준으로 확인했다.