Em 22 de setembro, a OpenAI lançou o GPT-6 Sol e o GPT-6 Luna, com os IDs de modelo gpt-6-sol e gpt-6-luna na API, disponíveis para uso no mesmo dia. Os preços de ambos os modelos correspondem à metade dos respectivos modelos da geração anterior, GPT-5.6, com janela de contexto de 1,1 milhão de tokens. No ChatGPT, os planos Work, Pro, Business, Enterprise e Edu já podem usar os dois modelos; o Luna também chega às versões gratuita e Go do aplicativo de desktop, e o Codex recebe a atualização junto com o ChatGPT Work. A OpenAI não divulgou os pesos dos modelos — ambos estão disponíveis apenas via API.
Os resultados divulgados pela OpenAI
No material de lançamento, a OpenAI listou alguns resultados:
- AutomationBench 1.0.6 (tarefas de trabalho profissional): o Sol, no nível de raciocínio xhigh, atingiu 33,2% de precisão, a um custo de 0,27 dólar por tarefa; o Luna, no nível high, ficou 5,4 pontos acima da geração anterior, com custo 58% menor.
- DeepSWE v1.1 (programação): o Sol atingiu 68,8% no nível max, o Luna 66,6%.
- OSWorld 2.0, versão offline (operação de computador): o Sol atingiu 60,5% no nível xhigh, segundo a OpenAI equivalente ao Opus 5 no nível médio, mas com custo 80% menor; o Luna, no nível max, superou o Sol da geração anterior, a cerca de um décimo do custo.
- Agents' Last Exam: o Sol atingiu 56,4% no nível max.
O lançamento também inclui um sistema de cache de prompts revisado. Segundo a OpenAI, a cada rodada um agente reenvia as mesmas instruções, definições de ferramentas e histórico; o novo sistema aumenta por padrão a taxa de acerto do cache, com desconto de até 90% na leitura.
A leitura de terceiros: preço menor, pontuação igual
O reteste da Artificial Analysis diverge do material oficial justamente na parte de capacidade. Segundo a empresa, o índice de inteligência e o índice de agente de codificação de ambos os modelos ficaram praticamente estáveis em relação ao GPT-5.6: no índice de agente de codificação, o Sol, no nível max, obteve 57 pontos, 2 a mais que a geração anterior; o Luna obteve 41 pontos, 2 a menos que a geração anterior.
A mudança no custo é o verdadeiro destaque deste lançamento. No mesmo teste de índice de inteligência, o Sol custa 1,06 dólar por tarefa no nível max, contra 1,99 dólar da geração anterior; o Luna custa 0,07 dólar, contra 0,18 dólar da geração anterior.
Fazendo as contas
Por uma estimativa aproximada com base nos números da Artificial Analysis: uma equipe que executa 10 mil tarefas semelhantes por dia economizaria cerca de 9.300 dólares por dia usando o Sol, quase 280 mil dólares por mês; ao migrar para o nível leve do Luna, com o mesmo volume de tarefas, o custo diário cairia de 1.800 para 700 dólares. Isso é apenas uma extrapolação direta dos números de benchmark — a conta real depende do tamanho das tarefas, do nível de raciocínio e da taxa de acerto do cache, especialmente esta última: em aplicações de agentes que reenviam repetidamente o prompt de sistema, cada dez pontos percentuais a mais na taxa de acerto economizam mais do que o próprio corte de preço.
Para comparação, no mesmo dia a Anthropic lançou o Claude Opus 5.5, com custo operacional geral 40% menor que o do Opus 5, a 4 dólares por entrada e 20 dólares por saída. As duas empresas baixaram os preços de seus modelos principais no mesmo dia; o preço do Sol é metade do do Opus 5.5, enquanto o Luna leva o nível leve a 0,10 dólar.
Para desenvolvedores na China, o impacto real desse corte de preços depende do caminho de acesso. Equipes que usam a API oficial diretamente sentem o desconto completo; as que passam por serviços de intermediação ou canais de provedores de nuvem terão de esperar por anúncios próprios sobre se a margem de acréscimo será ajustada. Em produtos de agentes cobrados pelo custo da tarefa, a estrutura de margem será a primeira a sentir a mudança: com a mesma funcionalidade, depois que o custo de inferência cai pela metade, desenhos que antes limitavam chamadas para controlar custo podem ser relaxados — ao preço de que os concorrentes também podem relaxar os seus.
Fontes: material de lançamento da OpenAI, artigo de avaliação da Artificial Analysis, CocoLoop, MarkTechPost; a avaliação de terceiros conferiu o custo por tarefa e a pontuação do índice de agente de codificação.