A OpenAI está se preparando para abrir o modo de inferência Ultrafast para mais desenvolvedores. Em 26 de setembro, a imprensa estrangeira encontrou, escondida na interface do Playground da Responses API, uma opção de velocidade ainda não ativada, dividida em três níveis: Standard, Fast e Ultrafast. A liberação pode ocorrer perto do DevDay, marcado para 29 de setembro, mas a OpenAI ainda não fez qualquer anúncio oficial, e o alcance exato depende da confirmação da empresa.
No momento, o Ultrafast está disponível apenas para um pequeno grupo de clientes convidados. Se a opção de três níveis for lançada oficialmente, a velocidade deixará de ser um privilégio de teste interno para se tornar uma opção de cobrança que qualquer desenvolvedor pode escolher conforme a tarefa.
Os números divulgados na pré-visualização de agosto
O Ultrafast estreou em 13 de agosto como uma pré-visualização limitada, disponível apenas para o modelo GPT-5.6 Sol. Segundo a OpenAI, o recurso chega a entregar 750 tokens por segundo, até 14 vezes mais rápido que o processamento no modo Standard, com poder de computação fornecido pelos chips de escala de wafer da Cerebras.
A Cerebras fez questão de destacar que não se trata de uma versão destilada ou quantizada, reduzida: a arquitetura do modelo, os pesos, a precisão, a configuração de contexto e os parâmetros de inferência são idênticos aos do GPT-5.6 Sol no endpoint padrão. A diferença de velocidade vem do hardware — cada chip de escala de wafer tem 44 GB de SRAM embutida, os pesos ficam residentes no próprio chip, o que elimina o tempo gasto movendo dados entre a memória e as unidades de computação.
As limitações da fase de pré-visualização também foram deixadas claras: disponível apenas via API, sem suporte no ChatGPT nem no Codex, e o ritmo de expansão acompanha a disponibilidade de capacidade computacional.
A Cerebras divulgou duas comparações próprias. No teste GDP-Val, que mede trabalho de conhecimento, o Ultrafast foi 5,6 vezes mais rápido de ponta a ponta, sem perda de qualidade; ao concluir as 2.500 questões do Humanity's Last Exam, a versão Ultrafast levou 11 horas e 11 minutos, contra 78 horas e 27 minutos do Claude Fable 5. Ambos os números vêm do blog da Cerebras, com condições de teste definidas pela própria empresa, e ainda não há reprodução independente por terceiros.
"It now finishes for me before I even have the opportunity to context-switch."
A frase é do pesquisador da OpenAI Jeffrey Wang, e significa que o resultado já sai antes mesmo de ele ter a chance de mudar para outra tarefa.
O terceiro passo com a Cerebras
Olhando a parceria entre OpenAI e Cerebras como um todo, o Ultrafast já é o terceiro marco.
Em janeiro deste ano, a OpenAI assinou um acordo de capacidade computacional com a Cerebras, comprometendo-se a implantar gradualmente 750 megawatts até 2028. O GPT-5.3-Codex-Spark, lançado em fevereiro, foi a primeira implementação concreta — um modelo de programação especialmente enxugado, rodando nos chips WSE-3 da Cerebras, com mais de 1.000 tokens por segundo, disponível apenas para o Codex dentro do ChatGPT Pro. Em abril, surgiram relatos de um compromisso adicional de compra de cerca de US$ 20 bilhões.
A abordagem do Codex-Spark foi criar um modelo pequeno dedicado à velocidade; o Ultrafast, em vez disso, faz o modelo principal rodar sem alterações em um hardware rápido. A primeira sacrifica parte da capacidade; a segunda não sacrifica capacidade nenhuma, mas transfere o custo para a computação. A capacidade de produção da Cerebras de sustentar uma abertura mais ampla é o que vai determinar até onde essa expansão realmente vai.
Como os três níveis se dividem
Com os três níveis lado a lado, os desenvolvedores podem escolher a latência conforme a tarefa. Em assistentes de programação e atendimento ao cliente em tempo real — cenários em que alguém está diante da tela esperando o resultado — a velocidade afeta diretamente a experiência; já em processamento em lote noturno e avaliações, ser um pouco mais lento em troca de um custo menor faz mais sentido. Dividir o mesmo modelo por velocidade de resposta lembra a lógica das provedoras de nuvem que cobram por tipo de instância.
Duas questões ainda não têm resposta. A primeira é o preço: desde a pré-visualização até agora, a OpenAI nunca divulgou o valor por unidade do Ultrafast, e a diferença de preço em relação ao nível Fast também é desconhecida. A segunda é a cobertura: GPT-6 Sol e GPT-6 Astra já foram lançados sucessivamente, mas ainda não é possível confirmar se todos os modelos GPT-6 oferecerão suporte ao Ultrafast já no lançamento.
Se a liberação realmente acontecer no dia do DevDay, a página de preços será o primeiro lugar que os desenvolvedores vão conferir.
Fontes: anúncio de pré-visualização do Ultrafast na comunidade de desenvolvedores da OpenAI, blog oficial da Cerebras, CocoLoop, TestingCatalog; os números de 750 tokens por segundo, aceleração de 14 vezes e aceleração de 5,6 vezes no GDP-Val são todos dados divulgados pela própria OpenAI e Cerebras.