Le GLM-4.5 de Zhipu ne nécessite que 8 cartes H20 pour fonctionner

Le GLM-4.5 de Zhipu AI a accompli une action très significative — il a été spécialement optimisé pour la NVIDIA H20 (la version de GPU destinée au marché chinois), et seulement huit cartes suffisent pour exécuter le modèle complet.

Pourquoi cela mérite d'être souligné

Après les restrictions américaines à l'exportation de puces vers la Chine, la meilleure GPU NVIDIA que les entreprises chinoises d'IA peuvent acheter est la H20 — une version dont la bande passante de calcul d'interconnexion a été « bridée ». De nombreux modèles étrangers de pointe ne fonctionnent pas sur la H20 ou le font avec une très faible efficacité.

Zhipu a choisi d'affronter cette contrainte de front, en adaptant l'architecture du modèle et le flux d'inférence spécifiquement aux caractéristiques matérielles de la H20. Le coût et la barrière à l'entrée de huit cartes H20 sont bien plus abordables que les solutions nécessitant des dizaines ou des centaines de cartes A100.

Adaptation technique

Les optimisations spécifiques incluent :

  • Ajustement de la méthode de calcul de l'attention en fonction des caractéristiques de bande passante mémoire de la H20
  • Stratégie de partitionnement du modèle conçue spécialement pour la configuration à 8 cartes
  • Schéma de quantification pour la phase d'inférence adapté à la précision de calcul de la H20

Performances

Le GLM-4.5 affiche des performances de premier plan national dans les tâches de compréhension et de génération de texte en chinois. Il est à égalité ou proche des modèles de niveau GPT-4 sur la plupart des benchmarks en chinois. Il existe un écart sur les tâches en anglais, mais cet écart se réduit.

Plus important encore est le coût réel de déploiement — pour les entreprises nationales, pouvoir utiliser du matériel légalement achetable pour obtenir des résultats proches de l'état de l'art a une valeur pratique bien plus grande que les scores de benchmark.

Impact sur l'industrie

L'approche de Zhipu représente une ligne de pensée de l'industrie chinoise de l'IA pour faire face aux restrictions sur les puces : ne pas attendre le meilleur matériel, mais utiliser le matériel existant pour obtenir les meilleurs résultats.

Cela s'inscrit dans la lignée de la stratégie de DeepSeek consistant à utiliser une puissance de calcul limitée pour réduire les coûts au minimum. Lorsque les conditions extérieures sont restrictives, la capacité d'optimisation technique forcée peut devenir un avantage concurrentiel à long terme.

Source de référence : CocoLoop, annonce officielle de Zhipu AI