OpenAI coloca Codex-Spark para rodar em Cerebras, 15 vezes mais rápido

Se você tem usado o Codex no ChatGPT Pro recentemente, deve ter notado uma nova opção chamada Codex-Spark, com uma velocidade de resposta incrivelmente rápida.

Isso não é resultado de ajuste de parâmetros, mas sim de uma mudança no hardware subjacente.

Rodando em qual chip

O GPT-5.3-Codex-Spark roda no Cerebras WSE-3 (Wafer Scale Engine 3), não em uma GPU Nvidia.

Esta é a primeira vez que a OpenAI implanta um modelo de produção formal em hardware de inferência que não seja da Nvidia.

O WSE-3 é uma pastilha de silício do tamanho de um prato de jantar, integrando mais de 4 trilhões de transistores, com uma memória interna enorme, projetado para eliminar gargalos de latência causados pelo movimento de dados.

Efeito prático: mais de 1000 tokens por segundo.

O GPT-5.3-Codex comum roda a cerca de 65 tokens/s. O Codex-Spark é cerca de 15 vezes mais rápido.

Escala do contrato entre OpenAI e Cerebras

A OpenAI assinou um contrato plurianual com a Cerebras em janeiro deste ano. Compromisso: implantar de forma faseada 750 megawatts de poder computacional da Cerebras até 2028, com um valor total de contrato superior a 10 bilhões de dólares.

No entanto, Sam Altman também não negou a Nvidia, sua declaração foi "a Nvidia fabricou os melhores chips do mundo", e a cooperação de longo prazo permanece inalterada. A estratégia atual da OpenAI é de múltiplos fornecedores em paralelo: Nvidia como principal para treinamento, Cerebras cobrindo inferência de baixa latência, AMD assinou um acordo de 6 GW, e chips personalizados da Broadcom também estão em desenvolvimento.

A declaração da Cerebras vem de Sachin Katti: "Trazer a computação em escala de wafer para o ambiente de produção nos dá uma nova maneira de manter o Codex responsivo em trabalhos sensíveis à latência."

Para que o Codex-Spark pode ser usado

A OpenAI o posiciona como uma "ferramenta de produtividade diária para desenvolvedores", não para raciocínio complexo e profundo, mas para trabalhos que exigem iteração rápida e feedback imediato:

  • Edição rápida de código e refatoração local
  • Depuração em tempo real e localização de erros
  • Escrever PRDs, documentos de pesquisa de usuário, métricas de monitoramento
  • Gerenciar testes e acompanhar o progresso de tarefas

O valor central é não esperar. Alterar uma função, fazer uma pergunta, testar uma lógica – resposta quase instantânea.

Ele suporta um modo de trabalho de "intervenção no meio do processo" – você pode interromper a execução da IA a qualquer momento, ajustar a direção, em vez de esperar que ela termine um longo bloco para ver o resultado.

Dados de benchmark

Métrica GPT-5.2-Codex GPT-5.3-Codex-Spark
Terminal-Bench 2.0 64% 77,3%
Velocidade de inferência ~65 tokens/s 1000+ tokens/s
Velocidade de saída relativa Base Cerca de 25% mais rápida
Consumo de tokens em algumas tarefas Base Cerca de 50% menor

As pontuações melhoraram e a velocidade ainda é 15 vezes maior – duas coisas que raramente acontecem ao mesmo tempo.

O significado maior disso

Atualmente, o Codex-Spark está disponível apenas para usuários pagantes do ChatGPT, o acesso à API ainda está a caminho, sem preço separado.

A OpenAI revelou que o Codex agora tem mais de 1 milhão de usuários ativos semanais. Nessa escala, a latência de inferência determina diretamente a experiência do produto, não é apenas um número em uma folha de especificações.

O sinal mais crítico está em: quando a Cerebras passa de "teoricamente poderia substituir a Nvidia" para "o primeiro hardware não-Nvidia que a OpenAI coloca em produção", essa mudança tem um peso específico na indústria de chips.

Quanto a se a Nvidia será afetada – no treinamento, ninguém pode abalá-la a curto prazo. Mas no mercado de inferência, essa fissura já foi aberta, e quem a abriu foi a OpenAI.

Fontes de referência: OpenAI launches GPT-5.3-Codex-Spark on Cerebras chips — marks AI giant's first production deployment away from Nvidia (Tom's Hardware); Introducing OpenAI GPT-5.3-Codex-Spark Powered (Cerebras AI Blog); CocoLoop; OpenAI's rapid GPT-5.3-Codex model moves beyond simple coding tasks (SiliconANGLE)