Camada Ultrafast do Sol chega para todos, preço é 6 vezes o padrão

O nível de inferência Ultrafast encerrou sua pré-visualização por convite. Em 8 de outubro, a OpenAI liberou oficialmente esse nível de serviço na Responses API para o GPT-6.1 Sol, e, por sinal, listou o preço na página de preços pela primeira vez. Na chamada, o modelo continua sendo gpt-6.1-sol; basta definir service_tier como "ultrafast". O modelo em si não mudou — o que diminui é o intervalo entre os tokens de saída.

O nível está disponível para todos os usuários da API, sujeito a limites de taxa, com suporte a processamento global e também a residência de dados nos EUA e na UE. Codex e ChatGPT Work foram lançados ao mesmo tempo, mas apenas para o Pro 500, planos empresariais elegíveis cobrados por uso e planos educacionais cobrados por pontos; na versão corporativa, um administrador precisa ativar manualmente.

Como funcionam os preços dos cinco níveis

Segundo a página de preços da OpenAI, até 272 mil tokens de entrada é considerado contexto curto; os preços por nível são (em dólares por milhão de tokens):

NívelEntradaEntrada em cacheEscrita em cacheSaída
Batch / Flex10.051.255
Standard20.102.5010
Fast40.20520
Ultrafast120.601560

Além de 272 mil tokens, no contexto longo, o Ultrafast sobe para 24 dólares na entrada e 90 na saída. Todos os preços são 6 vezes os do nível padrão, assim como os dois itens relacionados a cache.

O quanto é mais rápido, na prática

A documentação da OpenAI só traz múltiplos relativos, sem velocidade absoluta. A conta de desenvolvedores da OpenAI fala em "até cerca de 8 vezes"; vários veículos citam uma divisão mais detalhada: até cerca de 8 vezes no Codex, até cerca de 6 vezes na API. A VentureBeat noticiou uma velocidade de cerca de 300 tokens por segundo, número que não aparece na documentação oficial — o múltiplo é que vale como referência.

O Ultrafast tem limites de taxa próprios: 1 milhão de tokens por minuto no nível Build, 4 milhões no Launch, 40 milhões no Grow, sem consumir a cota dos níveis padrão e Fast.

O caso de uso que a OpenAI lista está escrito assim:

"Built for work where speed and intelligence make a difference: debugging an outage, agents navigating apps, and live experiences where every second counts."

(Feito para trabalhos em que velocidade e inteligência fazem diferença: depurar uma interrupção, agentes navegando em aplicativos e experiências em tempo real em que cada segundo conta.)

Fazendo as contas

Suponha uma tarefa de agente que lê 200 mil tokens e gera 20 mil tokens, sem contar cache. No cálculo aproximado, o nível padrão custa cerca de 0,6 dólar, o Fast cerca de 1,2 dólar e o Ultrafast cerca de 3,6 dólares.

Considerando a velocidade máxima de 6 vezes no cenário de API, uma tarefa que levava 6 minutos pode cair para cerca de 1 minuto, economizando 5 minutos ao custo de cerca de 3 dólares extras — o equivalente a 0,6 dólar a mais por minuto de espera economizado. Esse é o cenário mais favorável; quando o ganho real de velocidade não atinge o máximo, o custo por minuto fica maior.

Para um engenheiro investigando uma interrupção, esse valor praticamente não pesa; equipes que rodam tarefas offline em lote continuam com Batch e Flex, que custam a metade do nível padrão.

Esse nível já teve uma fase de pré-visualização antes. Em 13 de agosto, o Ultrafast debutou em pré-visualização limitada, disponível só no GPT-5.6 Sol; na época, a OpenAI dizia atingir até 750 tokens por segundo, até 14 vezes mais rápido que o processamento padrão, com capacidade computacional dos chips wafer-scale da Cerebras. Com o lançamento oficial no GPT-6.1 Sol, o múltiplo oficial passou a ser de 6 a 8 vezes, e o anúncio atual não menciona o hardware por trás.

A OpenAI ainda não divulgou volume de uso do Ultrafast nem a proporção de usuários pagantes. Também não há menção na documentação sobre se o nível vai se estender a outros modelos, como o Astra.

Fontes: changelog de desenvolvedores da OpenAI, CocoLoop, página de preços da API da OpenAI (preços por nível para contexto curto e longo), VentureBeat, Runtime Wire; a Runtime Wire conferiu os limites de taxa e o alcance do lançamento.