AMD persigue el nuevo modelo de DeepSeek, con rendimiento por dólar hasta 14,8 veces peor

En una publicación del 13 de septiembre, SemiAnalysis afirmó que AMD solo lanzó su propia imagen de DeepSeek V4.1 Flash dos días después de que vLLM, del lado CUDA, ya la soportara. La imagen en sí funciona lista para usar, sin funciones faltantes. La brecha está en la relación precio-rendimiento: según los cálculos de la firma, el mismo modelo ejecutado en hardware de AMD ofrece un rendimiento por dólar hasta 14,8 veces peor que en la H200, y hasta 42 veces peor que en las B200 y B300.

La explicación que da SemiAnalysis es el ecosistema. La colaboración de Nvidia con su comunidad de desarrolladores permite que la vía CUDA quede optimizada desde el primer día del lanzamiento del modelo; la firma cifra esa comunidad en 6 millones de desarrolladores.

De dónde sale la brecha de dos días

En los primeros días tras el lanzamiento de un modelo nuevo, el trabajo del lado de la inferencia se concentra en adaptar operadores, elegir la vía de cuantización y ajustar el planificador. El núcleo de desarrollo de frameworks de inferencia como vLLM y SGLang lleva mucho tiempo girando en torno a CUDA, y las implementaciones de referencia que hacen los propios fabricantes de modelos también suelen correr primero en CUDA. AMD tiene que esperar a que la rama principal se integre para después hacer una ronda de portado y validación: la diferencia de dos días es el resultado habitual de esa cadena.

DeepSeek V4.1 Flash es una generación de modelo que empezó en pruebas internas a inicios de septiembre y luego se lanzó oficialmente, con una estructura distinta a la de generaciones anteriores. Cuanto mayor es el cambio estructural, mayor es el costo de portado, y mayor la brecha de rendimiento el primer día.

El mismo orden de magnitud ya se había medido hace tres semanas

Retrocediendo tres semanas, el 24 de agosto SemiAnalysis ya había publicado un benchmark llamado AgentX 1.0, centrado en medir la inferencia de agentes con contexto largo. Esa prueba usó 393 trazas anonimizadas de llamadas de Claude Code, con un contexto de más de un millón de tokens, movilizando más de 1.000 tarjetas con un consumo de unos 2 megavatios, y un presupuesto registrado por encima de los 3 millones de dólares.

Los resultados de aquella vez variaron según el modelo: con Qwen3.5 sobre SGLang, en el nivel de 90 tok/s por usuario, Nvidia superó a AMD en más de 20 veces; con GLM 5.3, en el nivel de 150 tok/s por usuario, la eficiencia de costos de Nvidia fue alrededor de 5 veces mayor; la vía FP4 de la B300 elevó el rendimiento por dólar 12 veces respecto a la H100. El mismo material incluía una frase todavía más incómoda: en toda Alibaba, solo una pequeña unidad de publicidad usaba la pila ATOM de AMD.

El rango de 5 a 20 veces de hace tres semanas y el de 14,8 a 42 veces de ahora están en el mismo orden de magnitud. La diferencia es que AgentX medía un modelo que ya llevaba tiempo funcionando de forma estable, mientras que esta vez se midió un modelo nuevo en sus dos primeros días de lanzamiento, lo que amplía aún más la brecha en la fase de arranque en frío.

El hardware en sí no es el cuello de botella

Las especificaciones en papel de la MI355X no se quedan atrás. En su material de agosto, SemiAnalysis ya había señalado que, en ciertos niveles, aunque el chip de AMD se regalara, seguiría perdiendo en costo por token, hasta que vLLM y SGLang lo alcanzaran. Después del 21 de agosto, gracias a una serie de optimizaciones de Inferact y Nvidia incorporadas a vLLM, el rendimiento por dólar de la B200 superó al de la MI355X.

Para quien compra tarjetas, la lectura de estas cifras es que la variable decisiva en la compra pasó del rendimiento máximo a la madurez de la pila de software y a la latencia de adaptación a modelos nuevos. Para un proveedor de inferencia que necesite estar en línea el mismo día del lanzamiento de un modelo nuevo, la brecha de dos días de AMD significa dos días sin ingresos.

Puntos a tener en cuenta con estas cifras

Tanto el 14,8 como el 42 son datos unilaterales de SemiAnalysis; AMD no ha respondido y no hay reproducción independiente por terceros. El indicador de rendimiento por dólar es extremadamente sensible a los supuestos sobre el precio de las tarjetas: la diferencia de precio de mercado entre una H200 usada y una B300 nueva puede llevar el factor en cualquier dirección. Informes de benchmark anteriores de la firma sí divulgaron públicamente la metodología de prueba y el modelo de costos, pero esta publicación no viene acompañada de una descripción metodológica completa.

La pila de software de AMD lleva dos años tratando de ponerse al día. Si ese ritmo logra superar la inversión de Nvidia en optimización con cada nueva generación de hardware es algo que se sabrá cuando se lance el próximo modelo con un cambio estructural grande, y se vea cuántos días de diferencia quedan entre las imágenes de ambos lados.

Fuentes: SemiAnalysis, CocoLoop, registros públicos del proyecto vLLM; los factores de rendimiento por dólar y la escala de cómputo del benchmark AgentX se registran según lo divulgado por la propia SemiAnalysis, sin reproducción por terceros.