A OpenAI elevou em um nível a velocidade de saída padrão do GPT-6 Astra e do GPT-6.1 Sol nos produtos por assinatura. Thibault Sottiaux, responsável pelo Codex, anunciou em 5 de outubro em uma rede social que a velocidade padrão dos dois modelos aumentou, no geral, cerca de 50%, passando de aproximadamente 30 tokens por segundo para cerca de 50, cobrindo todos os produtos próprios da OpenAI e todos os aplicativos de parceiros conectados via "Sign in with ChatGPT".
Os usuários não precisam alterar nenhuma configuração. Segundo Sottiaux, a atualização será liberada gradualmente para todos dentro de duas horas.
A "melhoria" entregue no dia seguinte
O momento dessa aceleração não é coincidência. Em 4 de outubro, Sottiaux estabeleceu para a equipe do Codex um prazo público de 28 dias: todos os dias é preciso lançar algo que traga uma melhoria perceptível para a maioria dos usuários do Codex e do ChatGPT Work, ou então será feito um reset completo das cotas de uso para todos.
O aumento de velocidade se encaixa exatamente nesse critério de "perceptível para a maioria dos usuários". Ele não depende do cenário de uso — escrever código, pesquisar informações ou executar tarefas de agente se beneficiam igualmente — e também não exige que os usuários aprendam nenhum recurso novo. Em um compromisso que exige entregas diárias, esse tipo de mudança é o mais fácil de ser reconhecido.
O alcance também é maior do que uma simples mudança no ChatGPT. Os parceiros citados por Sottiaux incluem a ferramenta de programação de código aberto OpenCode, Pi, Amp, além do Devin, da Cognition. Esses produtos permitem que os usuários façam login diretamente com a assinatura do ChatGPT, consumindo a cota da assinatura em vez de cobrança por API — por isso, o ganho de velocidade do lado da assinatura é repassado integralmente a eles.
De 30 para 50: a conta dá mais do que a metade
O anúncio oficial fala em "cerca de 50%", mas, pelos dois números apresentados — de 30 para 50 tokens por segundo —, o aumento real é de cerca de 67%. Sottiaux não explicou a diferença entre as duas formas de calcular. Uma possibilidade é que os 50% se refiram à experiência completa, de ponta a ponta, incluindo o tempo de espera até o primeiro token, enquanto, olhando só para a fase de geração, o ganho seria de cerca de dois terços.
Convertendo isso em tempo percebido pelo usuário, uma estimativa simples:
| Tamanho da saída | 30 tokens/s | 50 tokens/s |
|---|---|---|
| Um trecho de código de 2.000 tokens | cerca de 67 segundos | cerca de 40 segundos |
| Uma tarefa de agente com saída de 20 mil tokens | cerca de 11 minutos | cerca de 6,7 minutos |
Isso considera apenas o tempo em que o modelo gera texto. Em tarefas de agente, ainda há chamadas de ferramentas, execução de testes e espera de rede, que não ficam mais curtas com o ganho de velocidade. Por isso, a proporção de tempo realmente economizada para concluir uma tarefa tende a ser menor do que os números da tabela sugerem.
Tokenizador e consumo de tokens
Sottiaux também mencionou que os dois modelos passaram a usar um tokenizador otimizado, o que reduz a quantidade de tokens necessária para concluir a mesma tarefa. A OpenAI não informou números específicos sobre essa redução.
Esse ponto pode ter um impacto mais direto para os assinantes do que a própria velocidade. As cotas do Codex e do ChatGPT Work são calculadas pelo consumo de tokens: se a mesma tarefa consumir menos tokens, a mesma cota permite fazer mais trabalho. Por outro lado, o simples aumento de velocidade não altera a cota em si — gerar texto mais rápido só faz o usuário atingir mais rapidamente o limite da janela de cinco horas. Alguns veículos de imprensa destacaram justamente esse ponto em suas coberturas.
Quando o GPT-6.1 Sol foi lançado na DevDay, em 29 de setembro, testes independentes constataram que ele usava de 10% a 30% mais tokens de saída do que a geração anterior para concluir a mesma tarefa. Quanto desse aumento o novo tokenizador consegue compensar só será possível saber quando testes independentes forem refeitos.
Sem mudanças, por ora, no lado da API
A divisão de papéis entre os dois modelos é clara. O GPT-6 Astra é o modelo principal, com preço padrão de API de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída; o GPT-6.1 Sol é voltado para agentes de programação e operação de computador, com US$ 2 de entrada e US$ 10 de saída — ambos equivalentes a um quinto do preço do Astra. Esse ganho de velocidade do lado da assinatura cobre os dois modelos simultaneamente.
Esse ajuste afeta apenas a velocidade padrão dos produtos por assinatura. Para os usuários de API, que pagam por token, não há menção, na fala de Sottiaux, sobre se a velocidade também mudou, e a documentação da API da OpenAI ainda não foi atualizada sobre o assunto.
Fontes: declarações públicas de Thibault Sottiaux em rede social, CocoLoop, RuntimeWire, Crypto Briefing; a taxa de saída segue os valores de tokens por segundo divulgados oficialmente, e o aumento e o tempo economizado foram estimados com base nesses números.