El nivel Ultrafast de Sol ya está disponible para todos, cuesta 6 veces el estándar

El nivel de inferencia Ultrafast ha terminado su vista previa por invitación. El 8 de octubre, OpenAI abrió oficialmente este nivel de servicio en la Responses API para GPT-6.1 Sol, y por primera vez mostró su precio en la página de tarifas. Al llamarlo, el modelo sigue siendo gpt-6.1-sol; solo hay que poner service_tier en "ultrafast". El modelo no cambia, lo que se reduce es el intervalo entre tokens de salida.

El nivel está disponible para todos los usuarios de la API, con límites de tasa, soporte de procesamiento global y también residencia de datos en EE. UU. y la UE. Codex y ChatGPT Work se lanzaron al mismo tiempo, pero solo para Pro 500, planes empresariales de pago por uso que califiquen y planes educativos de pago por puntos; en la versión empresarial un administrador debe activarlo manualmente.

Cómo se cobran los cinco niveles

Según la página de precios de OpenAI, hasta 272.000 tokens de entrada se considera contexto corto; los precios por nivel son (dólares por millón de tokens):

NivelEntradaEntrada en cachéEscritura en cachéSalida
Batch / Flex10.051.255
Standard20.102.5010
Fast40.20520
Ultrafast120.601560

Más allá de 272.000 tokens, en contexto largo, Ultrafast sube a 24 dólares de entrada y 90 de salida. Todos los precios son 6 veces los del nivel estándar, igual que los dos conceptos relacionados con la caché.

Cuánto más rápido es realmente

La documentación de OpenAI solo da múltiplos relativos, sin velocidad absoluta. La cuenta de desarrolladores de OpenAI habla de "hasta unas 8 veces"; varios medios citan un desglose más fino: hasta unas 8 veces en Codex, hasta unas 6 veces en la API. VentureBeat reportó una velocidad de unos 300 tokens por segundo, cifra que no aparece en la documentación oficial, así que el múltiplo es la referencia válida.

Ultrafast tiene límites de tasa propios: el nivel Build permite 1 millón de tokens por minuto, Launch 4 millones, Grow 40 millones, sin consumir la cuota de los niveles estándar y Fast.

El caso de uso que indica OpenAI está redactado así:

"Built for work where speed and intelligence make a difference: debugging an outage, agents navigating apps, and live experiences where every second counts."

(Pensado para trabajos donde la velocidad y la inteligencia marcan la diferencia: depurar una interrupción, agentes que navegan por aplicaciones y experiencias en vivo donde cada segundo cuenta.)

Haciendo cuentas

Supongamos una tarea de un agente que lee 200.000 tokens y genera 20.000, sin contar caché. A grandes rasgos: el nivel estándar costaría unos 0,6 dólares, Fast unos 1,2 dólares y Ultrafast unos 3,6 dólares.

Calculando con la velocidad máxima de 6 veces en el escenario de API, una tarea que antes tomaba 6 minutos podría reducirse a aproximadamente 1 minuto, ahorrando 5 minutos a cambio de unos 3 dólares más, lo que equivale a 0,6 dólares extra por cada minuto de espera que se ahorra. Este es el caso más favorable; cuando la aceleración real no llega al máximo, el costo por minuto sube.

Para un ingeniero que está depurando una interrupción, esta cantidad apenas importa; los equipos que ejecutan tareas por lotes sin conexión seguirán usando Batch y Flex, cuyo precio es la mitad del nivel estándar.

Este nivel ya tuvo una fase de vista previa antes. El 13 de agosto, Ultrafast debutó en vista previa limitada, disponible solo en GPT-5.6 Sol; en ese momento OpenAI afirmaba hasta 750 tokens por segundo, hasta 14 veces más rápido que el procesamiento estándar, con capacidad de cómputo de los chips wafer-scale de Cerebras. Con el lanzamiento oficial de GPT-6.1 Sol, el múltiplo oficial pasó a ser de 6 a 8 veces, y este anuncio no menciona el hardware subyacente.

OpenAI todavía no ha publicado el volumen de uso de Ultrafast ni la proporción de usuarios de pago. Tampoco la documentación menciona si se extenderá a otros modelos, como Astra.

Fuentes: registro de cambios para desarrolladores de OpenAI, CocoLoop, página de precios de la API de OpenAI (precios por nivel para contexto corto y largo), VentureBeat, Runtime Wire; Runtime Wire verificó los límites de tasa y el alcance del lanzamiento.