GLM-5.1, SWE-Bench Pro 1위 등극…훈련은 전량 화웨이 승텅 사용

4월 7일, Z.ai(구 지푸AI)가 754B 파라미터, MoE 아키텍처의 GLM-5.1을 MIT 라이선스로 오픈소스 공개했다.

벤치마크 결과: SWE-Bench Pro 58.4%로 세계 1위다. GPT-5.4는 57.7%, Claude Opus 4.6은 57.3%를 기록했다.

이 숫자만으로도 화제를 모으기에 충분하다 — 오픈소스 모델이 프로그래밍 능력이라는 차원에서 두 폐쇄형 플래그십 모델을 정면으로 추월했다. 하지만 더 흥미로운 점이 있다.

이 모델의 훈련은 화웨이 승텅 910B 칩MindSpore 프레임워크만으로 진행됐으며, NVIDIA GPU는 단 한 개도 사용되지 않았다.

모델 기술 사양

먼저 하드 스펙:

파라미터
총 파라미터 수754B
추론당 활성 파라미터40B
아키텍처MoE + 동적 희소 어텐션
컨텍스트 윈도우200K 토큰
최대 출력131,072 토큰
모델 파일 크기1.51TB (HuggingFace)
라이선스MIT

주요 벤치마크 점수:

  • SWE-Bench Pro: 58.4% (세계 1위)
  • CyberGym: 68.7%
  • BrowseComp: 68.0%
  • AIME 2026: 95.3%

SWE-Bench Pro는 실제 GitHub 이슈 수정을 테스트하며, 점수를 조작하기 쉬운 합성 데이터셋이 아니다. 58.4%라는 수치의 가치는 실질적이다.

8시간 작동 가능한 에이전트

GLM-5.1에는 자주 언급되지 않지만 중요한 능력이 있다: 자율 실행 능력이다.

공식 설명에 따르면 "8시간 이상 작업을 독립적으로 실행하며, 수백 라운드의 작업과 수천 번의 도구 호출을 처리" — 중단 없이 8시간 이상 연속 작동하며 수백 개의 작업 라운드와 수천 번의 도구 호출을 처리할 수 있다.

대부분의 모델은 복잡한 에이전트 작업에서 수십 라운드도 버티지 못하고 붕괴한다. 컨텍스트 윈도우가 가득 차고, 추론이 불안정해지며, 도구 호출이 루프에 빠진다. GLM-5.1은 이 분야에서 명확히 특화된 최적화를 적용했으며, 단순히 큰 컨텍스트 윈도우에 의존하지 않는다.

이는 엔터프라이즈급 에이전트 배포에 실질적인 진전이며, 벤치마크 점수 올리기가 아니다.

가장 주목할 점: NVIDIA 미사용

훈련 하드웨어: 화웨이 승텅 910B
훈련 프레임워크: 화웨이 MindSpore

이것은 사소한 세부사항이 아니다.

오랫동안 대규모 모델 훈련의 최적 경로는 거의 NVIDIA CUDA 하나뿐이었다. H100, H800, A100 — 사용 가능한 것을 사용했다. MindSpore의 엔지니어링 성숙도는 PyTorch에 크게 뒤처져 있었다.

GLM-5.1은 이 경로가 작동 가능함을 증명했다. 단순히 실행되는 것을 넘어, GPT-5.4와 Claude Opus 4.6을 이기는 모델을 훈련시킨 것이다.

"GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware"
— Awesome Agents

이 사실의 정치적 의미는 기술적 의미만큼 크다. 미국의 대중 AI 칩 수출 규제는 이제 미래의 위협이 아닌 현실적인 생산 제약이 되었다. GLM-5.1은 하나의 실험 결과다: 연산 자원이 제한된 조건에서 중국 AI 팀이 무엇을 달성할 수 있는가.

현재 답은: SWE-Bench Pro 세계 1위, MIT 라이선스 오픈소스, API 가격 $1.26/M 토큰.

가격 비교

GLM-5.1 API 가격:

  • 입력: $1.26/M 토큰
  • 출력: $3.96/M 토큰

비교 대상: Claude Opus 4.6은 약 $15/$75, GPT-5.4도 비슷한 수준이다.

SWE-Bench Pro 세계 1위의 프로그래밍 능력이 이 가격대에 있다면, AI 프로그래밍 인프라 개발자에게 선택지는 명확하다.

물론 SWE-Bench Pro가 모든 시나리오를 대표하지는 않는다. GLM-5.1은 수학적 추론과 일반 벤치마크에서 여전히 최고 폐쇄형 모델에 뒤처지며, 원문도 이 점을 회피하지 않았다. 이는 올라운드 챔피언이 아니라, 프로그래밍과 에이전트 방향에서 차별화된 특화 모델이다.

주목할 트렌드

최근 1년간 Z.ai(GLM-5.1), DeepSeek(V3.2), Kimi K2 등 중국 오픈소스 모델이 각 전문 벤치마크에서 연이어 1위를 차지했으며, MIT 또는 Apache 라이선스로 API 가격은 폐쇄형 경쟁사를 압도하고 있다.

Meta는 일부 폐쇄를 발표했고, OpenAI는 플래그십 모델을 진정으로 오픈소스화한 적이 없다 — 반면 중국 기업들은 가중치를 계속 공개하고 있다.

이러한 구도는 2025년 초에는 거의 상상할 수 없었던 것이다.

출처: Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro (WinBuzzer); CocoLoop, GLM-5.1 Tops SWE-Bench Pro With Zero NVIDIA Hardware (Awesome Agents); GLM-5.1 vs Claude, GPT, Gemini, DeepSeek: how Zhipu AI's model stacks up (APIdog)