OpenAI se está preparando para abrir el modo de inferencia Ultrafast a más desarrolladores. El 26 de septiembre, medios extranjeros descubrieron en la interfaz del Playground de la Responses API una opción de velocidad todavía sin activar, dividida en tres niveles: Standard, Fast y Ultrafast. La apertura podría coincidir con el DevDay del 29 de septiembre, aunque OpenAI no ha hecho ningún anuncio oficial y el alcance exacto queda pendiente de confirmación de la propia compañía.
Por ahora, Ultrafast solo está disponible para un pequeño grupo de clientes invitados. Si la opción de tres niveles se lanza oficialmente, la velocidad pasará de ser un privilegio de pruebas internas a una opción de facturación que cualquier desarrollador podrá elegir según la tarea.
Las cifras reveladas en la vista previa de agosto
Ultrafast debutó el 13 de agosto como una vista previa limitada, disponible únicamente para el modelo GPT-5.6 Sol. Según OpenAI, el modo llega a entregar hasta 750 tokens por segundo, hasta 14 veces más rápido que el procesamiento en modo Standard, con la potencia de cómputo proveniente de los chips a escala de oblea de Cerebras.
Cerebras insistió especialmente en que no se trata de una versión destilada ni cuantizada y reducida: la arquitectura del modelo, los pesos, la precisión, la configuración de contexto y los ajustes de inferencia son idénticos a los del GPT-5.6 Sol en el endpoint estándar. La diferencia de velocidad proviene del hardware: cada chip a escala de oblea cuenta con 44 GB de SRAM integrada, los pesos permanecen residentes en el propio chip, lo que elimina el tiempo de mover datos entre la memoria y las unidades de cómputo.
Las limitaciones de la fase de vista previa también quedaron claras: solo disponible vía API, sin soporte en ChatGPT ni en Codex, y el ritmo de expansión depende de la capacidad de cómputo disponible.
Cerebras publicó dos comparativas propias. En la prueba GDP-Val, que mide trabajo de conocimiento, Ultrafast fue 5,6 veces más rápido de extremo a extremo sin pérdida de calidad; al completar las 2.500 preguntas de Humanity's Last Exam, la versión Ultrafast tardó 11 horas y 11 minutos, frente a las 78 horas y 27 minutos de Claude Fable 5. Ambas cifras proceden del blog de Cerebras, con condiciones de prueba fijadas por la propia empresa, y por ahora no existe una reproducción independiente por terceros.
"It now finishes for me before I even have the opportunity to context-switch."
La frase es del investigador de OpenAI Jeffrey Wang, y significa que el resultado ya está listo antes de que le dé tiempo a cambiar a otra tarea.
El tercer paso junto a Cerebras
Visto en conjunto, el vínculo entre OpenAI y Cerebras, Ultrafast es ya el tercer hito.
En enero de este año, OpenAI firmó un acuerdo de cómputo con Cerebras, comprometiéndose a desplegar de forma progresiva 750 megavatios de capacidad hasta 2028. GPT-5.3-Codex-Spark, lanzado en febrero, fue la primera implementación concreta: un modelo de programación especialmente reducido, que corre sobre los chips WSE-3 de Cerebras, supera los 1.000 tokens por segundo y estaba reservado únicamente a Codex dentro de ChatGPT Pro. En abril trascendió además un compromiso de compra adicional cercano a los 20.000 millones de dólares.
El enfoque de Codex-Spark fue construir un modelo pequeño dedicado a la velocidad; Ultrafast, en cambio, hace que el modelo insignia corra sin cambios sobre hardware rápido. El primero sacrifica parte de la capacidad; el segundo no sacrifica capacidad, pero traslada el costo al cómputo. Que la capacidad de producción de Cerebras aguante una apertura más amplia determinará hasta dónde llega realmente esta expansión.
Cómo se reparten los tres niveles
Con los tres niveles conviviendo, los desarrolladores podrán elegir la latencia según la tarea. En asistentes de programación o atención al cliente en tiempo real —escenarios donde alguien está frente a la pantalla esperando el resultado— la velocidad afecta directamente la experiencia; en el procesamiento por lotes nocturno y las evaluaciones, ir algo más lento a cambio de menor costo tiene más sentido. Dividir un mismo modelo según la velocidad de respuesta recuerda a cómo los proveedores de nube cobran según el tipo de instancia.
Quedan dos preguntas sin respuesta. La primera es el precio: desde la vista previa hasta ahora, Ultrafast nunca ha publicado un precio por unidad, y tampoco está claro cuánto se diferenciará del nivel Fast. La segunda es la cobertura: GPT-6 Sol y GPT-6 Astra ya se han lanzado sucesivamente, pero por el momento no puede confirmarse que cada modelo de la serie GPT-6 soporte Ultrafast desde su lanzamiento.
Si finalmente se activa el mismo día del DevDay, la página de precios será lo primero que revisen los desarrolladores.
Fuentes: anuncio de vista previa de Ultrafast en la comunidad de desarrolladores de OpenAI, blog oficial de Cerebras, CocoLoop, TestingCatalog; las cifras de 750 tokens por segundo, la aceleración de 14 veces y la aceleración de 5,6 veces en GDP-Val son datos autoreportados por OpenAI y Cerebras.