Astra e Sol: assinatura acelera para 50 tokens por segundo

A OpenAI elevou em um nível a velocidade de saída padrão do GPT-6 Astra e do GPT-6.1 Sol nos produtos por assinatura. Thibault Sottiaux, responsável pelo Codex, anunciou em 5 de outubro em uma rede social que a velocidade padrão dos dois modelos aumentou, no geral, cerca de 50%, passando de aproximadamente 30 tokens por segundo para cerca de 50, cobrindo todos os produtos próprios da OpenAI e todos os aplicativos de parceiros conectados via "Sign in with ChatGPT".

Os usuários não precisam alterar nenhuma configuração. Segundo Sottiaux, a atualização será liberada gradualmente para todos dentro de duas horas.

A "melhoria" entregue no dia seguinte

O momento dessa aceleração não é coincidência. Em 4 de outubro, Sottiaux estabeleceu para a equipe do Codex um prazo público de 28 dias: todos os dias é preciso lançar algo que traga uma melhoria perceptível para a maioria dos usuários do Codex e do ChatGPT Work, ou então será feito um reset completo das cotas de uso para todos.

O aumento de velocidade se encaixa exatamente nesse critério de "perceptível para a maioria dos usuários". Ele não depende do cenário de uso — escrever código, pesquisar informações ou executar tarefas de agente se beneficiam igualmente — e também não exige que os usuários aprendam nenhum recurso novo. Em um compromisso que exige entregas diárias, esse tipo de mudança é o mais fácil de ser reconhecido.

O alcance também é maior do que uma simples mudança no ChatGPT. Os parceiros citados por Sottiaux incluem a ferramenta de programação de código aberto OpenCode, Pi, Amp, além do Devin, da Cognition. Esses produtos permitem que os usuários façam login diretamente com a assinatura do ChatGPT, consumindo a cota da assinatura em vez de cobrança por API — por isso, o ganho de velocidade do lado da assinatura é repassado integralmente a eles.

De 30 para 50: a conta dá mais do que a metade

O anúncio oficial fala em "cerca de 50%", mas, pelos dois números apresentados — de 30 para 50 tokens por segundo —, o aumento real é de cerca de 67%. Sottiaux não explicou a diferença entre as duas formas de calcular. Uma possibilidade é que os 50% se refiram à experiência completa, de ponta a ponta, incluindo o tempo de espera até o primeiro token, enquanto, olhando só para a fase de geração, o ganho seria de cerca de dois terços.

Convertendo isso em tempo percebido pelo usuário, uma estimativa simples:

Tamanho da saída30 tokens/s50 tokens/s
Um trecho de código de 2.000 tokenscerca de 67 segundoscerca de 40 segundos
Uma tarefa de agente com saída de 20 mil tokenscerca de 11 minutoscerca de 6,7 minutos

Isso considera apenas o tempo em que o modelo gera texto. Em tarefas de agente, ainda há chamadas de ferramentas, execução de testes e espera de rede, que não ficam mais curtas com o ganho de velocidade. Por isso, a proporção de tempo realmente economizada para concluir uma tarefa tende a ser menor do que os números da tabela sugerem.

Tokenizador e consumo de tokens

Sottiaux também mencionou que os dois modelos passaram a usar um tokenizador otimizado, o que reduz a quantidade de tokens necessária para concluir a mesma tarefa. A OpenAI não informou números específicos sobre essa redução.

Esse ponto pode ter um impacto mais direto para os assinantes do que a própria velocidade. As cotas do Codex e do ChatGPT Work são calculadas pelo consumo de tokens: se a mesma tarefa consumir menos tokens, a mesma cota permite fazer mais trabalho. Por outro lado, o simples aumento de velocidade não altera a cota em si — gerar texto mais rápido só faz o usuário atingir mais rapidamente o limite da janela de cinco horas. Alguns veículos de imprensa destacaram justamente esse ponto em suas coberturas.

Quando o GPT-6.1 Sol foi lançado na DevDay, em 29 de setembro, testes independentes constataram que ele usava de 10% a 30% mais tokens de saída do que a geração anterior para concluir a mesma tarefa. Quanto desse aumento o novo tokenizador consegue compensar só será possível saber quando testes independentes forem refeitos.

Sem mudanças, por ora, no lado da API

A divisão de papéis entre os dois modelos é clara. O GPT-6 Astra é o modelo principal, com preço padrão de API de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída; o GPT-6.1 Sol é voltado para agentes de programação e operação de computador, com US$ 2 de entrada e US$ 10 de saída — ambos equivalentes a um quinto do preço do Astra. Esse ganho de velocidade do lado da assinatura cobre os dois modelos simultaneamente.

Esse ajuste afeta apenas a velocidade padrão dos produtos por assinatura. Para os usuários de API, que pagam por token, não há menção, na fala de Sottiaux, sobre se a velocidade também mudou, e a documentação da API da OpenAI ainda não foi atualizada sobre o assunto.

Fontes: declarações públicas de Thibault Sottiaux em rede social, CocoLoop, RuntimeWire, Crypto Briefing; a taxa de saída segue os valores de tokens por segundo divulgados oficialmente, e o aumento e o tempo economizado foram estimados com base nesses números.