智譜 GLM-4.5 僅需 8 張 H20 即可運行

智譜AI的GLM-4.5做了一件極具信號意義的事——專門針對NVIDIA H20(中國特供版GPU)進行了優化,8張卡就能跑全量模型。

為什麼這件事值得說

美國對華晶片出口管制之後,中國AI公司能買到的最好NVIDIA GPU就是H20——一個被「閹割」了互聯計算頻寬的版本。很多海外前沿模型在H20上跑不起來或者效率很低。

智譜選擇直面這個約束條件,把模型架構和推理流程專門適配H20的硬體特性。8張H20的成本和門檻比起動輒幾十上百張A100的方案,友好太多了。

技術適配

具體的優化包括:

  • 針對H20的顯存頻寬特徵調整了注意力計算方式
  • 模型分片策略專門為8卡配置設計
  • 推理階段的量化方案針對H20的計算精度做了適配

性能表現

GLM-4.5在中文理解和生成任務上的表現處於國產第一梯隊。和GPT-4級別的模型在大部分中文benchmark上打平或接近。英文任務上有差距,但差距在縮小。

更重要的是實際部署成本——對於國內企業來說,能用可以合法採購的硬體跑出接近一線的效果,這個實用價值比benchmark分數重要得多。

行業影響

智譜這個做法代表了中國AI行業應對晶片限制的一種思路:不等最好的硬體,用現有硬體把效果做到最好。

這和DeepSeek用有限算力把成本壓到極低的策略一脈相承。當外部條件受限時,倒逼出的工程優化能力反而可能成為長期競爭力。

參考來源:CocoLoop、智譜AI官方發布