Se você tem usado o Codex no ChatGPT Pro recentemente, deve ter notado uma nova opção chamada Codex-Spark, com uma velocidade de resposta incrivelmente rápida.
Isso não é resultado de ajuste de parâmetros, mas sim de uma mudança no hardware subjacente.
Rodando em qual chip
O GPT-5.3-Codex-Spark roda no Cerebras WSE-3 (Wafer Scale Engine 3), não em uma GPU Nvidia.
Esta é a primeira vez que a OpenAI implanta um modelo de produção formal em hardware de inferência que não seja da Nvidia.
O WSE-3 é uma pastilha de silício do tamanho de um prato de jantar, integrando mais de 4 trilhões de transistores, com uma memória interna enorme, projetado para eliminar gargalos de latência causados pelo movimento de dados.
Efeito prático: mais de 1000 tokens por segundo.
O GPT-5.3-Codex comum roda a cerca de 65 tokens/s. O Codex-Spark é cerca de 15 vezes mais rápido.
Escala do contrato entre OpenAI e Cerebras
A OpenAI assinou um contrato plurianual com a Cerebras em janeiro deste ano. Compromisso: implantar de forma faseada 750 megawatts de poder computacional da Cerebras até 2028, com um valor total de contrato superior a 10 bilhões de dólares.
No entanto, Sam Altman também não negou a Nvidia, sua declaração foi "a Nvidia fabricou os melhores chips do mundo", e a cooperação de longo prazo permanece inalterada. A estratégia atual da OpenAI é de múltiplos fornecedores em paralelo: Nvidia como principal para treinamento, Cerebras cobrindo inferência de baixa latência, AMD assinou um acordo de 6 GW, e chips personalizados da Broadcom também estão em desenvolvimento.
A declaração da Cerebras vem de Sachin Katti: "Trazer a computação em escala de wafer para o ambiente de produção nos dá uma nova maneira de manter o Codex responsivo em trabalhos sensíveis à latência."
Para que o Codex-Spark pode ser usado
A OpenAI o posiciona como uma "ferramenta de produtividade diária para desenvolvedores", não para raciocínio complexo e profundo, mas para trabalhos que exigem iteração rápida e feedback imediato:
- Edição rápida de código e refatoração local
- Depuração em tempo real e localização de erros
- Escrever PRDs, documentos de pesquisa de usuário, métricas de monitoramento
- Gerenciar testes e acompanhar o progresso de tarefas
O valor central é não esperar. Alterar uma função, fazer uma pergunta, testar uma lógica – resposta quase instantânea.
Ele suporta um modo de trabalho de "intervenção no meio do processo" – você pode interromper a execução da IA a qualquer momento, ajustar a direção, em vez de esperar que ela termine um longo bloco para ver o resultado.
Dados de benchmark
| Métrica | GPT-5.2-Codex | GPT-5.3-Codex-Spark |
|---|---|---|
| Terminal-Bench 2.0 | 64% | 77,3% |
| Velocidade de inferência | ~65 tokens/s | 1000+ tokens/s |
| Velocidade de saída relativa | Base | Cerca de 25% mais rápida |
| Consumo de tokens em algumas tarefas | Base | Cerca de 50% menor |
As pontuações melhoraram e a velocidade ainda é 15 vezes maior – duas coisas que raramente acontecem ao mesmo tempo.
O significado maior disso
Atualmente, o Codex-Spark está disponível apenas para usuários pagantes do ChatGPT, o acesso à API ainda está a caminho, sem preço separado.
A OpenAI revelou que o Codex agora tem mais de 1 milhão de usuários ativos semanais. Nessa escala, a latência de inferência determina diretamente a experiência do produto, não é apenas um número em uma folha de especificações.
O sinal mais crítico está em: quando a Cerebras passa de "teoricamente poderia substituir a Nvidia" para "o primeiro hardware não-Nvidia que a OpenAI coloca em produção", essa mudança tem um peso específico na indústria de chips.
Quanto a se a Nvidia será afetada – no treinamento, ninguém pode abalá-la a curto prazo. Mas no mercado de inferência, essa fissura já foi aberta, e quem a abriu foi a OpenAI.
Fontes de referência: OpenAI launches GPT-5.3-Codex-Spark on Cerebras chips — marks AI giant's first production deployment away from Nvidia (Tom's Hardware); Introducing OpenAI GPT-5.3-Codex-Spark Powered (Cerebras AI Blog); CocoLoop; OpenAI's rapid GPT-5.3-Codex model moves beyond simple coding tasks (SiliconANGLE)