El GLM-4.5 de Zhipu AI ha hecho algo con un fuerte significado simbólico — ha sido optimizado específicamente para la NVIDIA H20 (la versión de GPU para el mercado chino), necesitando solo ocho tarjetas para ejecutar el modelo completo.
Por qué esto es relevante
Tras las restricciones de exportación de chips de EE. UU. a China, la mejor GPU NVIDIA que las empresas chinas de IA pueden comprar es la H20, una versión con el ancho de banda de computación de interconexión "recortado". Muchos modelos extranjeros de vanguardia no funcionan en la H20 o lo hacen con una eficiencia muy baja.
Zhipu ha optado por enfrentar esta limitación directamente, adaptando la arquitectura del modelo y el flujo de inferencia específicamente a las características del hardware de la H20. El costo y la barrera de entrada de ocho tarjetas H20 son mucho más accesibles que las soluciones que requieren decenas o cientos de tarjetas A100.
Adaptación técnica
Las optimizaciones específicas incluyen:
- Ajuste del método de cálculo de atención según las características de ancho de banda de memoria de la H20
- Estrategia de fragmentación del modelo diseñada específicamente para la configuración de 8 tarjetas
- Esquema de cuantización para la fase de inferencia adaptado a la precisión computacional de la H20
Rendimiento
GLM-4.5 muestra un rendimiento de primer nivel nacional en tareas de comprensión y generación de texto en chino. Iguala o se acerca a modelos de nivel GPT-4 en la mayoría de los benchmarks en chino. Hay una brecha en tareas en inglés, pero se está reduciendo.
Más importante es el costo real de implementación — para las empresas nacionales, poder usar hardware legalmente adquirible para obtener resultados cercanos a los de punta tiene un valor práctico mucho mayor que las puntuaciones de benchmark.
Impacto en la industria
El enfoque de Zhipu representa una línea de pensamiento de la industria china de IA para enfrentar las restricciones de chips: no esperar el mejor hardware, sino usar el hardware existente para obtener los mejores resultados.
Esto está en línea con la estrategia de DeepSeek de usar potencia computacional limitada para reducir los costos al mínimo. Cuando las condiciones externas son restrictivas, la capacidad de optimización de ingeniería forzada puede convertirse en una ventaja competitiva a largo plazo.
Fuente de referencia: CocoLoop, comunicado oficial de Zhipu AI