GLM-4.5 da Zhipu precisa de apenas 8 placas H20 para funcionar

O GLM-4.5 da Zhipu AI fez algo com grande significado simbólico — foi otimizado especificamente para a NVIDIA H20 (a versão de GPU para o mercado chinês), sendo necessário apenas oito placas para executar o modelo completo.

Por que isso é relevante

Após as restrições dos EUA à exportação de chips para a China, a melhor GPU NVIDIA que as empresas chinesas de IA podem comprar é a H20 — uma versão com largura de banda de computação de interconexão "capada". Muitos modelos estrangeiros de ponta não funcionam na H20 ou operam com eficiência muito baixa.

A Zhipu optou por enfrentar essa limitação de frente, adaptando a arquitetura do modelo e o fluxo de inferência especificamente para as características de hardware da H20. O custo e a barreira de entrada de oito placas H20 são muito mais acessíveis do que soluções que exigem dezenas ou centenas de placas A100.

Adaptação técnica

As otimizações específicas incluem:

  • Ajuste do método de cálculo de atenção com base nas características de largura de banda de memória da H20
  • Estratégia de fragmentação do modelo projetada especificamente para a configuração de 8 placas
  • Esquema de quantização para a fase de inferência adaptado à precisão computacional da H20

Desempenho

O GLM-4.5 apresenta desempenho de primeira linha nacional em tarefas de compreensão e geração de texto em chinês. Ele iguala ou se aproxima de modelos de nível GPT-4 na maioria dos benchmarks em chinês. Há uma diferença em tarefas em inglês, mas essa diferença está diminuindo.

Mais importante é o custo real de implantação — para empresas domésticas, poder usar hardware legalmente adquirível para obter resultados próximos aos de ponta tem um valor prático muito maior do que pontuações de benchmark.

Impacto no setor

A abordagem da Zhipu representa uma linha de pensamento da indústria de IA chinesa para lidar com as restrições de chips: não esperar pelo melhor hardware, mas usar o hardware existente para obter os melhores resultados.

Isso está alinhado com a estratégia da DeepSeek de usar poder computacional limitado para reduzir os custos ao mínimo. Quando as condições externas são restritas, a capacidade de otimização de engenharia forçada pode se tornar uma vantagem competitiva de longo prazo.

Fonte de referência: CocoLoop, comunicado oficial da Zhipu AI