Em 30 de setembro, o Google lançou sua nova geração de modelo de ponta, o Gemini 4 Argon, mas o primeiro acesso ficou restrito às equipes de defesa cibernética do programa Fairwind. O Google limitou o escopo de uso do modelo a três áreas: engenharia de software, trabalho de conhecimento corporativo como jurídico e financeiro, e defesa cibernética. Clientes de API pagos e assinantes do Google AI Ultra entram na próxima leva, e ainda não há previsão para uma liberação pública mais ampla.
Priorizar as equipes de segurança está ligado à forma como o modelo foi treinado. Segundo o Google, o Argon recebeu treinamento específico para defesa cibernética, sendo capaz de descobrir, verificar e corrigir sozinho vulnerabilidades críticas de software. Para os defensores confiáveis dentro do Fairwind e as equipes internas do Google, o Argon é fornecido sem as barreiras de segurança cibernética; os demais usuários recebem uma versão com medidas como proteção contra uso indevido, contra injeção de prompt e monitoramento de alinhamento.
O boletim oficial de resultados
O Google divulgou os seguintes resultados em benchmarks:
| Benchmark | Área | Resultado do Argon |
|---|---|---|
| DeepSWE v1.1 | Engenharia de software real | 77,9% |
| CWE-bench v1 | Correção de vulnerabilidades | 68% (empatado em primeiro) |
| AutomationBench | Tarefas de automação | 51,3% (primeiro lugar) |
| LVBench | Compreensão de vídeos longos | 91,7% |
Outros dois testes tiveram apenas a colocação divulgada: no Vals Index, que abrange finanças, programação, área jurídica e tributária, o Google afirma que o Argon está na liderança; no teste de injeção de prompt indireta da Gray Swan, o Google diz que o desempenho do Argon contra esse tipo de ataque é o melhor. Todos esses números são autodeclarados pela empresa, e no dia do lançamento apenas uma reavaliação independente estava disponível.
O comprimento da saída é outra mudança notável. O limite de saída por resposta da geração anterior do Gemini era de 64 mil tokens; no Argon, esse número sobe para 1 milhão de tokens, e a janela de contexto também é de 1 milhão.
Preços e testes independentes
No período de lançamento, a API é cobrada a preço promocional: 2 dólares por milhão de tokens de entrada, 10 dólares por milhão de tokens de saída, com desconto adicional de 95% para entradas que acertam o cache. Após o fim da promoção, os preços voltam a 4 dólares para entrada e 20 dólares para saída; o Google não informou a duração do período promocional.
A avaliadora independente Artificial Analysis divulgou seus resultados no mesmo dia. O Argon obteve 53 pontos no índice de inteligência da empresa, empatado com o nível mais alto de raciocínio do GPT-6 Astra, um ponto acima do nível mais alto do GPT-6.1 Sol e 23 pontos acima dos 30 pontos da geração anterior, o Gemini 3.1 Pro Preview.
Comparando o custo por tarefa usando o mesmo índice:
- o Argon custa cerca de 1,99 dólar por tarefa no preço promocional, contra 3,26 dólares do GPT-6 Astra;
- após o fim da promoção, o Argon sobe para cerca de 3,98 dólares, cerca de 20% mais caro que o Astra;
- o GPT-6.1 Sol custa cerca de 0,72 dólar por tarefa, com apenas 1 ponto a menos de pontuação, tornando o Argon, a preço promocional, cerca de 2,8 vezes mais caro.
A diferença vem principalmente do consumo de tokens. Segundo a Artificial Analysis, o Argon gera em média cerca de 62 mil tokens de saída por tarefa, contra cerca de 27 mil do GPT-6 Astra, mais do que o dobro. Com o preço unitário cortado pela metade e o volume de saída dobrado, a vantagem de preço no valor cheio acaba praticamente anulada. O Argon suporta um mecanismo chamado "continuação de decodificação longa", em que o processo de raciocínio pode chegar a escrever até 1 milhão de tokens de saída, o que explica o consumo mais alto nos testes de índice.
Para quem ficam as barreiras de segurança
Na mesma semana, a OpenAI cancelou o lançamento do GPT-6.1 Astra alegando que ele não atendia aos padrões de segurança, optando por lançar o Sol, mais barato. O caminho do Google foi colocar primeiro a versão mais poderosa em uma lista controlada. As duas empresas adotam abordagens diferentes diante do mesmo tipo de capacidade: quanto mais forte é um modelo para encontrar vulnerabilidades e escrever correções, maior também é o risco de ele ser usado para ataques.
O blog de lançamento do Google não detalha quais organizações estão na lista do Fairwind, quais critérios são usados na avaliação, nem como a versão sem barreiras é protegida contra vazamentos. Para desenvolvedores na China, o Argon também é, por ora, difícil de alcançar: o Fairwind funciona por convite, não há data definida para a abertura do Ultra e da API paga, e a própria API do Gemini não atende à China continental.
Fontes: blog oficial do Google, relatório de avaliação da Artificial Analysis, CocoLoop, VentureBeat; as pontuações de benchmark seguem os dados divulgados pelo Google, e o custo por tarefa e o consumo de tokens seguem o índice de inteligência da Artificial Analysis.