Si has estado usando Codex en ChatGPT Pro recientemente, es posible que hayas notado una nueva opción llamada Codex-Spark, con una velocidad de respuesta inusualmente rápida.
Esto no es el resultado de un ajuste de parámetros, sino de un cambio en el hardware subyacente.
¿En qué chip se ejecuta?
GPT-5.3-Codex-Spark se ejecuta en el Cerebras WSE-3 (Wafer Scale Engine 3), no en una GPU de Nvidia.
Es la primera vez que OpenAI implementa un modelo de producción formal en hardware de inferencia que no sea de Nvidia.
El WSE-3 es una oblea de silicio del tamaño de un plato de cena, que integra más de 4 billones de transistores, con una memoria interna masiva, diseñado para eliminar los cuellos de botella de latencia causados por el movimiento de datos.
Efecto práctico: más de 1000 tokens por segundo.
El GPT-5.3-Codex normal funciona a aproximadamente 65 tokens/s. Codex-Spark es aproximadamente 15 veces más rápido.
Escala del contrato entre OpenAI y Cerebras
OpenAI firmó un contrato plurianual con Cerebras en enero de este año. Compromiso: implementar de forma escalonada 750 megavatios de potencia informática de Cerebras para 2028, con un valor total del contrato superior a los 10 mil millones de dólares.
Sin embargo, Sam Altman tampoco negó a Nvidia, su declaración fue "Nvidia ha fabricado los mejores chips del mundo", y la cooperación a largo plazo permanece sin cambios. La estrategia actual de OpenAI es de múltiples proveedores en paralelo: Nvidia como principal para el entrenamiento, Cerebras cubriendo la inferencia de baja latencia, AMD firmó un acuerdo de 6 GW, y los chips personalizados de Broadcom también están en desarrollo.
La declaración de Cerebras proviene de Sachin Katti: "Llevar la computación a escala de oblea al entorno de producción nos brinda una nueva forma de mantener a Codex receptivo en trabajos sensibles a la latencia."
¿Para qué se puede usar Codex-Spark?
OpenAI lo posiciona como una "herramienta de productividad diaria para desarrolladores", no para razonamiento complejo y profundo, sino para trabajos que requieren iteración rápida y retroalimentación inmediata:
- Edición rápida de código y refactorización local
- Depuración en tiempo real y localización de errores
- Redacción de PRD, documentos de investigación de usuarios, métricas de monitoreo
- Gestión de pruebas y seguimiento del progreso de tareas
El valor central es no esperar. Modificar una función, hacer una pregunta, probar una lógica: respuesta casi instantánea.
Admite un modo de trabajo de "intervención en medio del proceso": puedes interrumpir la ejecución de la IA en cualquier momento, ajustar la dirección, en lugar de esperar a que termine un bloque grande para ver el resultado.
Datos de benchmark
| Métrica | GPT-5.2-Codex | GPT-5.3-Codex-Spark |
|---|---|---|
| Terminal-Bench 2.0 | 64% | 77,3% |
| Velocidad de inferencia | ~65 tokens/s | 1000+ tokens/s |
| Velocidad de salida relativa | Base | Aprox. 25% más rápida |
| Consumo de tokens en algunas tareas | Base | Aprox. 50% menor |
Las puntuaciones han mejorado y la velocidad es 15 veces mayor, dos cosas que rara vez ocurren al mismo tiempo.
El significado más amplio de esto
Actualmente, Codex-Spark solo está disponible para usuarios de pago de ChatGPT, el acceso a la API aún está en camino, sin un precio separado.
OpenAI reveló que Codex ahora tiene más de 1 millón de usuarios activos semanales. A esta escala, la latencia de inferencia determina directamente la experiencia del producto, no es solo un número en una hoja de especificaciones.
La señal más crítica radica en: cuando Cerebras pasa de "teóricamente podría reemplazar a Nvidia" a "el primer hardware que no es de Nvidia que OpenAI pone en producción", este cambio tiene un peso específico en la industria de los chips.
En cuanto a si Nvidia se verá afectada – en el entrenamiento, a corto plazo nadie puede moverla. Pero en el mercado de inferencia, esta grieta ya se ha abierto, y quien la abrió fue OpenAI.
Fuentes de referencia: OpenAI launches GPT-5.3-Codex-Spark on Cerebras chips — marks AI giant's first production deployment away from Nvidia (Tom's Hardware); Introducing OpenAI GPT-5.3-Codex-Spark Powered (Cerebras AI Blog); CocoLoop; OpenAI's rapid GPT-5.3-Codex model moves beyond simple coding tasks (SiliconANGLE)