Zhipu GLM-4.5, H20 8장만으로 전체 모델 구동 가능

Zhipu AI의 GLM-4.5가 상징적인 의미가 큰 행보를 보였습니다. NVIDIA의 중국 전용 GPU인 H20에 특화된 최적화를 적용해, 8장의 카드만으로 전체 모델을 실행할 수 있게 된 것입니다.

주목해야 하는 이유

미국의 대중국 칩 수출 규제 이후, 중국 AI 기업이 구매할 수 있는 최고 수준의 NVIDIA GPU는 H20입니다. 이는 상호 연결 컴퓨팅 대역폭이 축소된 버전입니다. 많은 해외 최첨단 모델이 H20에서 실행되지 않거나 효율이 매우 낮습니다.

Zhipu는 이러한 제약 조건에 정면으로 대응하여 모델 아키텍처와 추론 파이프라인을 H20의 하드웨어 특성에 맞게 특별히 조정했습니다. H20 8장의 비용과 진입 장벽은 수십, 수백 장의 A100이 필요한 방식에 비해 훨씬 낮습니다.

기술적 적응

구체적인 최적화는 다음과 같습니다:

  • H20의 메모리 대역폭 특성에 맞춘 어텐션 계산 방식 조정
  • 8카드 구성에 특화된 모델 분할 전략 설계
  • 추론 단계의 양자화 방식을 H20의 계산 정밀도에 맞게 조정

성능

GLM-4.5는 중국어 이해 및 생성 작업에서 국산 모델 최상위권의 성능을 보여줍니다. 대부분의 중국어 벤치마크에서 GPT-4 수준의 모델과 동등하거나 근접합니다. 영어 작업에서는 격차가 있지만 그 차이는 줄어들고 있습니다.

더 중요한 것은 실제 배포 비용입니다. 국내 기업 입장에서 합법적으로 조달 가능한 하드웨어로 최첨단에 가까운 효과를 낼 수 있다는 실용적 가치는 벤치마크 점수보다 훨씬 중요합니다.

업계 영향

Zhipu의 이러한 접근 방식은 중국 AI 업계가 칩 제한에 대응하는 하나의 전략을 보여줍니다. 최고의 하드웨어를 기다리지 않고, 기존 하드웨어로 최고의 효과를 내는 것입니다.

이는 제한된 연산 자원으로 비용을 극도로 낮춘 DeepSeek의 전략과 맥을 같이합니다. 외부 조건이 제한될 때, 그 압박이 오히려 장기적인 경쟁력이 될 수 있는 엔지니어링 최적화 능력을 길러냅니다.

출처: CocoLoop, Zhipu AI 공식 발표