La directora financiera de OpenAI, Sarah Friar, dijo el 8 de septiembre en la conferencia Communacopia de Goldman Sachs que la empresa ya está usando sus propios modelos de vanguardia en el diseño de chips, lo que permitió que el chip de inferencia desarrollado internamente, Jalapeno, pasara del diseño a la versión final en solo 9 meses. También mencionó el diseño de chips, las ciencias de la vida y los servicios financieros como tres sectores en los que la empresa quiere enfocarse, argumentando que la demanda de IA construida en torno a flujos de trabajo especializados está creciendo en estas áreas.
Jalapeno es un chip de inferencia desarrollado conjuntamente por OpenAI y Broadcom, anunciado públicamente en junio de este año, cuyo propósito es ejecutar los modelos propios de la empresa a menor costo. Según lo divulgado públicamente, las primeras muestras pueden ahorrar cerca de la mitad del costo en comparación con las unidades de procesamiento gráfico de IA típicas. No se ha revelado la fecha de entrega del chip.
Un ritmo de 9 meses se considera corto para chips personalizados. Un nuevo ASIC de inferencia suele tardar, según los estándares de la industria, entre un año y medio y dos años desde la arquitectura final hasta el tape-out. Friar atribuyó esta reducción al uso de los modelos propios, pero no especificó qué etapas exactamente asumieron los modelos: el diseño físico y el enrutamiento, la verificación, o incluso la exploración de arquitectura en una etapa anterior.
Comparando Luna con GLM-5.3
La parte sobre precios fue lo más concreto de la intervención. Friar dijo que, tras el recorte del 80% en el precio de Luna, el precio de entrada bajó a 0,20 USD por millón de tokens, el de salida quedó en 1,20 USD, y el uso aumentó cerca de 10 veces después. Luego señaló directamente un modelo de código abierto chino como punto de comparación:
"If you're deploying Luna and compare that to (Z.ai's) GLM 5.3, for example, on a cloud layer, we are cheaper."
Si estás desplegando Luna y lo comparas, por ejemplo, con el GLM 5.3 de Zhipu AI, en la capa de nube, somos más baratos.
El criterio de esta frase merece atención. Ella comparó el despliegue de GLM-5.3 "en la nube", es decir, el precio real de los pesos abiertos alojados por un proveedor de nube externo, mientras que el precio público de la API propia de Zhipu AI es otra referencia distinta: al lanzarse, GLM-5.3 anunció un precio de salida de 4,40 USD por millón de tokens. El mismo modelo puede tener precios que difieren varias veces entre su API propia y una nube de terceros, porque esta última debe repartir los costos de ocupación de GPU, memoria y uso concurrente. OpenAI no reveló el criterio completo de esta comparación de precios ni el nivel de rendimiento (throughput) asumido en la comparación.
La presión real sobre el lado del código abierto chino
Este argumento apunta al escenario de empresas que alojan su propia infraestructura. En los últimos dos años, las principales razones para que empresas dentro y fuera de China eligieran pesos abiertos fueron dos: los datos no salen del entorno controlado, y el cálculo propio resulta más barato. La primera razón no se ve afectada, pero la segunda está siendo presionada por los recortes de precio del lado de código cerrado. Cuando el precio de salida de Luna baja a 1,20 USD, y además hay un chip de inferencia propio detrás que sigue empujando los precios hacia abajo, la cuenta de que "alojar uno mismo sale más barato" debe rehacerse, especialmente para los equipos con baja concurrencia y una utilización de GPU que no logra subir.
Hay que aclarar que las cifras de Friar representan la perspectiva del vendedor; terceros aún no han hecho un cálculo público de precio unitario que compare Luna y GLM-5.3 en las mismas condiciones de rendimiento, y Zhipu AI tampoco ha respondido a esta comparación.
Fuentes: Reuters, Qz, CocoLoop; varios reportajes fueron contrastados para confirmar los precios de entrada y salida y el porcentaje de recorte de precio de Luna, la proporción entre el ciclo de diseño y el costo de las muestras de Jalapeno, y la declaración original de Friar en inglés.